AI HOT 日报 · 2026-08-13

2026-08-13 AI HOT 日报:共 20 条 AI 圈要闻,覆盖模型发布/更新、产品发布/更新、行业动态、论文研究、技巧与观点,聚焦大模型发布、AI 产品更新与行业动态,每日更新。 📚 查看全部日报

模型发布/更新

  1. xAI 发布 Grok 4.6,强化长时运行智能体能力 — xAI:News(网页) xAI 今日发布 Grok 4.6,在 Grok 4.5 基础上重点强化长时运行智能体及更复杂的交互式与视觉工作能力。该模型在多项智能体编码与知识工作基准上达到前沿水平,在 Artificial Analysis Intelligence Index(九项基准综合分)上追平 GPT-5.6 Sol。 https://aihot.virxact.com/items/cmsqabu0f001krouc6sfhic2d

  2. 阿里开放 Qwen3.8-2.4T-A95B 模型权重:2.4T MoE、激活 95B、原生 256K 上下文 — IT之家(RSS) 阿里 Qwen 团队正式开放 Qwen3.8-2.4T-A95B 模型权重,这是 Qwen-Max 级别模型首次开源。模型总参数 2.4T,每个 Token 激活 95B,原生支持 262,144 Token 上下文并可扩展至 1,010,000 Token。 https://aihot.virxact.com/items/cmsqagyyz00yuroucf55e5fue

  3. LTX-2.5 模型登场:AI 生成 10 秒 720P 视频仅需 6.8 秒,原生集成 ComfyUI — IT之家(RSS) LTX 推出 LTX-2.5 模型,原生集成 ComfyUI,在 2 张英伟达 GB200 配置下生成 10 秒 720P 视频仅需 6.8 秒。LTX-2.5 Fast 以每秒 0.09 美元生成带音频 720p 视频,10 秒片段成本 0.90 美元;年度经常性收入低于 1,000 万美元的组织可免费使用。 https://aihot.virxact.com/items/cmspr6h6s01hero4hjcdf95mw

  4. 微软首发自研推理模型MAI-Thinking-1 — X:Mustafa Suleyman(Microsoft AI CEO) (@mustafasuleyman) 我们的首个推理模型 MAI-Thinking-1 从零开始构建,现已在 Microsoft Foundry 上线。为团队点赞!更多详情如下。 https://aihot.virxact.com/items/cmsqbnb8j01nrroosmwa5r6mj

产品发布/更新

  1. OpenRouter 推出实时网页搜索基准测试:如何为智能体选择引擎、深度与模型 — OpenRouter:Announcements(RSS) OpenRouter 发布实时排行榜,系统评测模型、搜索引擎、搜索方法与预算四类配置组合。数据显示,将搜索预算从 1 轮增至 25 轮可使 BrowseComp 得分近乎翻倍,成本仅增 2.5-7 倍;模型选择比引擎更重要,平均分差 15 分 vs 10 分。失败率高的任务应降低搜索深度以控制成本。 https://aihot.virxact.com/items/cmsq9h6gs01x5ronde8fdla7e

  2. Claude in Chrome 侧边栏升级为 Claude Cowork 会话 — Claude:Blog(网页) Claude in Chrome 浏览器扩展的侧边栏现已升级为 Claude Cowork 会话,对话会保存至历史记录,技能和连接器可在浏览器中工作,且任务可在桌面、网页和移动端应用间无缝切换。 https://aihot.virxact.com/items/cmsqj4ly004izroxvzl349s3r

  3. SGLang 与 Miles 为 Qwen3.8-2.4T-A95B 提供 Day-0 支持 — LMSYS:Blog(Chatbot Arena 团队) SGLang 与 Miles 在发布首日即支持 Qwen3.8-2.4T-A95B,这是 Qwen 最大的开源模型,总参数 2.4T,每 token 激活 95B,采用混合注意力架构。 https://aihot.virxact.com/items/cmsq9tn9a001mroxag87x1ltg

  4. WhatsApp 如何用端到端加密与可验证性构建 Scam Alert 诈骗提醒功能 — Meta Engineering Blog(RSS) WhatsApp 推出可选功能 Scam Alert,通过端到端加密保护下在设备端运行机器学习模型,识别潜在诈骗消息,且消息内容不会离开设备或自动上报。该功能遵循仅设备端处理、无自动上报、用户控制三大原则,模型权重公开供独立验证,遥测数据经差分隐私聚合处理。目前已在 Beta 版有限推出,并邀请安全研究社区参与测试。 https://aihot.virxact.com/items/cmsq5eksf0481ro2ebve4t2jq

  5. Claude Code v2.1.229 发布:新增远程会话恢复、插件市场命令源及多项修复 — Claude Code:GitHub Releases(RSS) Claude Code v2.1.229 发布,新增远程控制会话恢复、自托管 runner 的服务器端 hook 支持,以及插件市场命令源。修复了长响应流式输出丢失、窄终端渲染崩溃、Windows 扩展路径崩溃等问题。改进工作流扇出以复用缓存提示前缀,并调整 /commit-push-pr 对危险 git/gh 命令不再自动批准。 https://aihot.virxact.com/items/cmsqklahe05ifroxvk12gixbx

行业动态

  1. Research Gold 号称“100%人类撰写、绝不使用AI”,实则全程由AI驱动 — Hacker News 热门(buzzing.cc 中文翻译) 面向医学研究者的网站 Research Gold 宣称其服务“100%由人类撰写、绝不使用AI”,并列出多名博士审稿人。但调查发现,这些审稿人系AI生成、并不存在;部分真实方法学家的身份和照片未经许可被挪用。致电该公司时,自称“Sarah”的AI助手坚称自己是真人,邮件与聊天回复也均为AI生成。 https://aihot.virxact.com/items/cmspo193n05q2rojeue8j2k5a

  2. RingCentral 如何用 ChatGPT Work 和 Codex 构建 AI 原生工作流 — OpenAI:官网动态(RSS · 排除企业/客户案例) RingCentral 通过全员发放 ChatGPT Work 和 Codex,推动从工程到运营的 AI 原生开发,其 AI-Native Challenge 让数千名员工(含非技术人员)交付了可运行项目。 https://aihot.virxact.com/items/cmsqmvjex02jbrow2udzat483

论文研究

  1. 空货架还是丢钥匙?Google 研究:Recall 是参数化事实性的瓶颈 — Google Research:Blog(网页) Google Research 提出知识画像框架,发现前沿 LLM(如 Gemini3、GPT-5)的事实编码接近饱和,但回忆(recall)能力不足,多数事实错误源于“丢钥匙”而非“空货架”。该框架将事实分为编码失败、回忆失败等五类画像,并配套推出 WikiProfile 基准,含 2,150 条维基百科事实,每条配 10 个问题,用于分别探测编码、回忆与识别能力。 https://aihot.virxact.com/items/cmsqe6mat01bsroli3hw71nz7

  2. Anthropic 联合独立研究者发布工人再培训项目证据综述 — Anthropic:Research(发表成果 · 网页) Anthropic 与独立研究者 David Roodman 合作发布报告,基于 56 项美国随机研究和欧洲实验证据,评估工人再培训项目应对 AI 劳动力市场冲击的效果。 https://aihot.virxact.com/items/cmsqcs2m402xzroosy1xpgvm0

技巧与观点

  1. 零基础用户半天上手AI的12步实操流程 — 公众号:数字生命卡兹克 文章给出一套零基础用户半天上手AI的12步实操流程:准备内存不低于16G的电脑,订阅ChatGPT并安装Codex或使用WorkBuddy,用语音输入法以【背景、痛点、需求】框架向AI交代任务,经苏格拉底提问澄清需求后投喂文件让AI直接完成,最后沉淀为可复用Skill。文中建议Codex选GPT-5.6 Sol最高模型,WorkBuddy选Kimi K3。 https://aihot.virxact.com/items/cmspc30un0e4xrorts1kax9zg

  2. DeepSeek V4 Pro与Grok 4.6同日发布,双双逼近Claude Fable 5体验 — 公众号:数字生命卡兹克 DeepSeek V4 Pro正式版与Grok 4.6在2小时内先后发布,均为1.6T/1.5T参数模型,逼近Claude Fable 5体验。 https://aihot.virxact.com/items/cmsqq3bc001snro7vo8picfbp

  3. AutoGPT 如何用 AGENTS.md 和技能门控管理 AI 生成的拉取请求 — GitHub Blog AutoGPT 维护者发现,AI 智能体不会主动阅读文档,因此将指令放在 AGENTS.md 和技能文件中,并置于代码目录旁。他们通过强制 PR 模板、测试计划、CI 覆盖率门槛和 CLA 签名等门控机制,将智能体提交的 PR 从“不可用”转变为“可用但不符合路线图”。其中 CLA 签名因需浏览器和 OAuth 流程,被用作区分人类与智能体的“人类探测器”。 https://aihot.virxact.com/items/cmsqgeo2e02cvroxvpnycl2zi

  4. 我写了一本 AI 教科书——AI 还要多久才能写得更好? — Nathan Lambert:Interconnects(RSS) 作者在完成一本 RLHF 教科书后反思,LLM 在长文非虚构写作上进展停滞,GPT 4.5 和 Kimi K2 等写作强模型已显老旧,而编码、数学等任务已接近超人水平。模型能改错字、做编辑,但组织整章内容时仍混乱且易出错,作者认为这阻碍了模型自主解决开放科学问题。 https://aihot.virxact.com/items/cmsq5saxh051mro2e90h10exo

  5. OpenRouter 工具调用指南:一次编写循环,切换模型字符串即可跨模型运行 — OpenRouter:Announcements(RSS) OpenRouter 发布工具调用指南,展示如何用同一套代码在 Claude、GPT 和开源权重模型间切换,仅需更改模型字符串。指南涵盖定义工具、发送请求、读取 tool_calls 响应、执行函数并返回结果的完整循环,支持 OpenAI 兼容的 JSON schema,并提供 cURL、Python 和 JavaScript/TypeScript 示例。 https://aihot.virxact.com/items/cmsql9mbw065uroxvb09rxir4

  6. LangChain 详解:什么是 AI 智能体? — LangChain:Blog(RSS) AI 智能体是在大语言模型循环中自主运行的系统,通过反复调用模型、观察结果并调整下一步行动来完成复杂任务。工作流(workflow)则是对固定步骤的预编排,两者互补:工作流保证确定性,智能体提供灵活性。理解二者差异是构建可靠、可投入生产的自主系统的关键。 https://aihot.virxact.com/items/cmsppq8pe01dxrog7ppmbaug9

  7. OpenAI 研究:企业如何用 ChatGPT 和 Codex 落地智能体 AI — OpenAI:官网动态(RSS · 排除企业/客户案例) OpenAI 研究揭示企业采用智能体 AI 的方式,以及前沿企业如何在 AI 应用上拉开差距。企业正通过 ChatGPT 和 Codex 将 AI 从辅助转向执行,头部公司已率先将智能体投入实际业务流程。 https://aihot.virxact.com/items/cmsq3ulbm02wero2em6p0huto

补充视野 · Horizon

来源:Horizon Daily(Thysrael 的 AI 聚合日摘)· 已与 AI HOT 去重,仅保留 AI HOT 未覆盖的条目

  1. Qwen3.8-2.4T:2.4T 参数开源 MoE 模型发布 — Horizon 评分 9.0/10 · 科技新闻 阿里巴巴 Qwen 团队发布开源 MoE 模型 Qwen3.8-2.4T-A95B,总参数量 2.4T、激活参数 95B,原生上下文 262,144 tokens,可扩展至 1,010,000 tokens;目前提供 BF16 和 FP8 版本。社区将其视为 Kimi k3 的竞争对手,并引用 Unsloth 的 1-bit 量化结果(约 397GB、激活 95B)称可在消费级硬件上运行,但完整无损 BF16 版本约需 4.9TB 存储。由于未提供面向 Q4 的 QAT 量化,且许可限制内部使用或年收入低于 5000 万美元的商用场景,服务与合规门槛成为主要关注点。官方另发布 Qwen3.8-Max,开放权重版不包含视觉输入、非思考模式、默认 1M 上下文与内置工具等功能。 https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B

  2. DeepSeek V4 Pro 0813 发布,社区称编码性能强劲且成本低 — Horizon 评分 8.0/10 · 科技新闻 DeepSeek V4 Pro 0813 通过 OpenRouter 页面发布,并迅速在 Hacker News 上引发关注,社区报告显示该模型编码性能强劲且使用成本较低。尽管 OpenRouter 页面本身缺乏详细技术信息,但多个开发者反馈其在开发任务中表现出色,例如有用户表示在流量模拟和分布式物理引擎任务上取得了显著收益。目前官方基准测试和完整定价细节尚未在 OpenRouter 页面上提供,需要参考 DeepSeek 官方文档或社区转发的内容。该版本继续延续 DeepSeek Flash 更新后的低成本路线,对追求性价比的 AI 开发者和机器学习从业者具有吸引力。 https://openrouter.ai/deepseek/deepseek-v4-pro-0813

  3. Tailscale 数据库损坏源于 SQLite 16 年历史缺陷 — Horizon 评分 8.0/10 · 科技新闻 Tailscale 在一篇事后分析中详细说明了一个存在约 16 年的 SQLite WAL-reset 竞态条件如何损坏其控制平面数据库。该数据库由一个 Go 进程独占访问,符合 SQLite 的预期使用方式,但仍然触发了缺陷。团队通过资助开源的 SQLite VFS shim 工具迅速隔离问题,并最终修复、提供了可复现的测试用例、向社区贡献工具以避免类似问题。文章还提到 Tailscale 作为商业公司购买了 SQLite 支持合同。此事件展示了罕见的老旧 SQLite 缺陷在单写者配置下仍可能造成数据库损坏。 https://tailscale.com/blog/sqlite-wal-reset-bug

  4. 高尔斯:LLM 擅长采样式数学,而非人类式定理证明 — Horizon 评分 8.0/10 · 科技新闻 菲尔兹奖得主蒂莫西·高尔斯(Timothy Gowers)在一次分析中评估了大型语言模型擅长与不擅长的数学类型,指出当前模型更接近基于采样的方法,而非人类式的定理证明。他强调,虽然 LLM 在生成候选答案并筛选方面表现出色,但距离产出那种“事后看来优美自然”的新颖证明仍有明显差距。社区评论进一步将这一论点与测试时扩展(test-time scaling)联系起来,并援引 Google AlphaCode 在 2022 年通过生成数百万个候选程序并筛选、击败普通人类程序员的表现作为采样路径的早期证据。总体来看,专家观点认为 LLM 更适合用作数学发现的辅助工具,而不是替代人类推理的定理证明者。 https://gowers.wordpress.com/2026/08/12/what-sort-of-maths-are-llms-good-at/

  5. 微信发布资源效率优先的 WeLM 大语言模型家族 — Horizon 评分 8.0/10 · 科技新闻 腾讯微信团队发布 WeLM 大语言模型系列,主打资源效率,目标是让大模型能力在微信海量用户场景中规模化落地。目前已落地的 WeLM-80B(总参数 80B,激活参数 3B)已应用于微信内 AI 智能体“小微”,可支持对话与搜索、操作微信原生功能以及调用小程序服务。研发中的 WeLM-617B 采用混合专家(MoE)架构,以 23B 激活参数在中等激活规模下实现更强的通用理解与推理能力,计划用于小程序智能开发和“微信小微”小工具生成等复杂任务。该发布体现了微信在兼顾部署成本与模型能力方面的技术路线。 https://x.com/Weixin_WeChat/status/2087509298310209718

  6. Zed 推出 Delta:实时协作的 AI 代理对话功能 — Horizon 评分 7.0/10 · 科技新闻 Zed 发布了代号为 Delta 的新功能,为编辑器带来实时协作的 AI 代理对话,并将对话以持久化文档的形式保存。该功能允许多人同时查看或参与 AI 代理的工作过程,从而把 AI 辅助开发从单人交互扩展为团队协作。Delta 面向软件工程和 AI 工作流,但目前公开信息未说明具体版本、发布时间或适用条件。 https://zed.dev/blog/introducing-delta

  7. 通过 WebSocket 传 HTML:几乎零 JavaScript 的实时 SPA — Horizon 评分 7.0/10 · 科技新闻 这篇文章介绍了一种构建实时单页应用(SPA)的技术:通过 WebSocket 直接把 HTML 推送给浏览器,从而大幅减少客户端 JavaScript 代码。作者认为,对于聊天、协作、游戏等需要双向低延迟通信的场景,WebSocket 是合适选择;如果服务器只是单向推送,使用 SSE(Server-Sent Events)更简单便宜。文中提到 Chris McCord 是该技术(服务器驱动 UI)的早期实践者,先有 Rails 中的 Sync 演示,后来在 Phoenix LiveView 中成熟。社区评论指出,该方案实际已有较长历史,也有人认为 htmx 配合 SSE 和 DOM 交换即可实现类似效果。没有提供具体的性能数据或版本信息。 https://en.andros.dev/blog/ef4968f5/html-over-websockets-real-time-spas-with-barely-any-javascript/

  8. Chrome 中微小 JPEG 显示差异的原因 — Horizon 评分 7.0/10 · 科技新闻 一篇技术文章解释了为什么 Chrome 的优化 JPEG 缩小算法会让微小图片看起来与 Firefox 不同。文章指出,JPEG 本身适合照片而非图标,并强调应使用与显示尺寸匹配的图片分辨率。评论中还提到 Chrome 的该“优化”也会影响 PNG 图标,并曾导致 Electron 应用升级时出现问题。Firefox 正在通过 Bugzilla(编号 2033250)推进缩小解压的相关工作。 https://guillaumetech.github.io/posts/jpg-scaling-chrome/

  9. AI 正在淘汰中级软件工程师? — Horizon 评分 7.0/10 · 科技新闻 一篇由 florianherrengt 撰写的博客文章提出,AI 和大语言模型正在通过自动化大量常规编码任务,逐步消除软件工程中的中级岗位。文章认为,过去需要中级工程师把设计拆解成可实现任务并写出样板代码的工作,现在越来越多可以由 AI 完成,因此公司对这类角色的需求会下降。作者提醒,工程师应把精力放在系统设计、判断力与长期可维护性上,而不是重复性的代码翻译工作。该观点在 Hacker News 上引发 669 条评论的广泛讨论,反映出行业对岗位结构变化的强烈不安。 https://blog.florianherrengt.com/ai-removing-middle-class-software-engineering.html

  10. 块层错误注入:新增按磁盘 debugfs 规则接口 — Horizon 评分 7.0/10 · 科技新闻 Christoph Hellwig 提交了一组补丁,为 Linux 块层增加可配置的 I/O 错误注入接口:启用 CONFIG_BLK_ERROR_INJECTION 后,每个 gendisk 会在 debugfs 的 /sys/kernel/debug/block/ 下获得一个 error_injection 文件。通过写入逗号分隔规则,可以选择要失败的块层操作(如 READ、WRITE、DISCARD)和返回状态(如 IOERR、TIMEOUT、TRANSPORT),并可限定起始扇区、扇区数和失败概率(chance=10 表示十分之一的匹配请求失败)。现有 fail_make_request、should_fail_bio() 和 dm-error/dm-flakey/dm-dust 等方法无法同时做到限定操作类型、状态码以及直接作用在目标磁盘上;新接口则无需堆叠设备即可对单个磁盘注入精确错误。该补丁系列还提供了 Documentation/block/error-injection.rst 说明规则格式,并以 nvme0n1 上对第 1000 至 1499 扇区的读请求注入传输错误的示例演示用法。 https://lwn.net/Articles/1086344/

  11. QEMU 11.1 发布,包含超过 3200 个提交 — Horizon 评分 7.0/10 · 科技新闻 QEMU 项目发布了 11.1 版本,这一版本包含来自 285 位作者的超过 3200 个提交,并带来一长串改进。官方发布公告和变更日志提供了详细内容。此次更新对虚拟化与模拟社区具有重要意义,具体改进细节需参阅 QEMU 官方网站和 wiki。 https://lwn.net/Articles/1088490/

  12. 白宫拟将开源模型纳入发布前安全测试 — Horizon 评分 7.0/10 · 科技新闻 白宫据报将修订其人工智能政策框架,把达到“前沿”能力的开源模型纳入发布前安全测试范围。目前该自愿框架仅覆盖 Anthropic、OpenAI 等闭源模型,未来数月预计扩展至开源模型。由于特朗普政府认为正式监管只会帮助中国追赶美国,该框架仍属自愿性质。部分官员担忧可能的 30 天测试要求会抑制美国企业发展。这一变动将直接影响开源模型发布流程及相关的 AI 安全监管讨论。 https://www.wired.com/story/the-white-house-is-going-to-expand-its-ai-policy/

  13. NVIDIA AI 工厂全栈可观测性选型指南 — Horizon 评分 8.0/10 · 科技博客 「背景」 作者指出 AI 基础设施跨越计算、网络、存储、编排和应用多层,灰度故障(如 InfiniBand 链路误码率升高但未“宕机”)会在批量同步并行训练中拖慢最慢 rank,层层放大为吞吐下降;跨层遥测关联因此成为定位根因的关键。 https://developer.nvidia.com/blog/how-to-choose-full-stack-observability-for-nvidia-ai-factories/

  14. AI 代码廉价后,三大开发平台的赌注 — Horizon 评分 6.0/10 · 科技博客 「背景」 当 AI 能廉价地直接把描述变成能运行的代码时,代码生成本身就不再是平台的差异化能力。作者指出,价值因此转移到代码产出之后的工程环节:代理在哪里运行代码、如何验证它真的可用、以及如何安全地送到生产环境。 https://blog.bytebytego.com/p/github-vs-vercel-vs-replit-what-dev

  15. 腾讯 Q2 营收超预期,资本开支激增致自由现金流转负 — Horizon 评分 8.0/10 · 财经新闻 腾讯控股 2026 年第二季度营收 2048 亿元,同比增长 11%,略超彭博预期;净利润 560 亿元,同比仅增 0.7%,低于市场预期。资本开支同比接近翻三倍至 528 亿元,使自由现金流转为负 138 亿元;公司称剔除 AI 算力预付款后自由现金流为 376 亿元。 https://wallstreetcn.com/articles/3779275


数据来源:AI HOT (aihot.virxact.com) · 补充:Horizon Daily