AI HOT 日报 · 2026-09-04
2026-09-04 AI HOT 日报:共 21 条 AI 圈要闻,覆盖模型发布/更新、产品发布/更新、行业动态、技巧与观点,聚焦大模型发布、AI 产品更新与行业动态,每日更新。 📚 查看全部日报
模型发布/更新
-
OpenAI 发布 GPT-6 Astra:1.05M 上下文的计算机操作模型,因触及 Critical 网络安全阈值而限制访问 — MarkTechPost(RSS) OpenAI 发布 GPT-6 Astra,定位为计算机操作模型,提供 1,050,000 token 上下文窗口、128,000 最大输出 token,2026 年 4 月 30 日知识截止,OSWorld V2-Offline 得分 72.6%(GPT-5.6 Sol 为 65.7%),平均任务时间从约 75 分钟降至 40 分钟。 https://aihot.virxact.com/items/cmtm1j0qe0uchrow5ozapge42
-
OpenAI 发布新模型 Astra,主打计算机与浏览器操作但因 opaque recurrence 引发争议 — TechCrunch:AI(RSS) OpenAI 发布最新模型 Astra,称其为迄今最强大模型,主打计算机和浏览器操作,先面向 Daybreak 网络安全计划客户开放,随后一周内覆盖 Pro、Plus、Enterprise、Business 付费账户及 API。 https://aihot.virxact.com/items/cmtlu0vyd0nelrow5qppvereu
-
OpenAI 开始发布 GPT-6 Astra,面向全部 Plus 用户开放 — X:Tibo (@thsottiaux) OpenAI 宣布开始发布 GPT-6 Astra,称正以尽可能谨慎和快速的方式推进,重点让全部 Plus 用户可用,而不只限 Pro、Business 和 Enterprise 套餐。发布需几天完成,背后多个全新系统将首次大规模运行,团队正带来大量算力,详情见 openai.com/index/gpt-6-astra/。 https://aihot.virxact.com/items/cmtlyijvl0rlsrow5dwqv22k7
-
OpenAI 发布 GPT-6 Astra,多项基准达到 SOTA — X:Sherwin Wu(@sherwinwu) OpenAI 发布 GPT-6 Astra,在 FrontierMath Tier 4、ARC-AGI 3、TerminalBench-4.0 上达到 SOTA,并在 Terminal-Bench Science 0.1 和 HealthBench Pro 上取得领先成绩。 https://aihot.virxact.com/items/cmtlzumiu0sojrow5820i30sg
-
IFM 发布 K2 Horizon 六款开源模型,覆盖 0.9B 到 375B-A23B 并开放完整训练生命周期 — Hacker News 热门(buzzing.cc 中文翻译) IFM 发布 K2 Horizon 模型系列,共六个模型:375B-A23B、36B-A4B、32B、7B、3.7B 和 0.9B,均以 Apache 2.0 开源,其中 0.9B、3.7B 和 7B 宣称在其规模上达到 SOTA,36B-A4B 采用新提出的稀疏注意力架构 MoVA。 https://aihot.virxact.com/items/cmtlu0yka0neurow5as9e6jtu
-
OpenAI 发布 GPT-6 Astra,首个达到关键级网络安全能力门槛的模型 — IT之家(RSS) OpenAI 于 9 月 3 日发布新一代大语言模型 GPT-6 Astra,是其首个达到准备框架中关键级网络安全能力门槛的模型,可在无逐步指导下发现防护严密系统的未知漏洞。 https://aihot.virxact.com/items/cmtm3lnrg022wrooelnc62oo9
-
OpenAI 发布 GPT-6 Astra,官方基准显示 ARC-AGI-3 得分 99.9% — X:Kim (@kimmonismus) https://aihot.virxact.com/items/cmtlwgygo0pnorow5q12m2p9j
-
OpenAI 发布 GPT-6 Astra,基准全面超越 Claude Fable 5.1 — X:Kim (@kimmonismus) 作者引用 OpenAI 官方基准称 GPT-6 Astra 以 99.9% 饱和 ARC-AGI-3,在 ExploitBench 得 100%,并在各项基准上全面超过此前保持 SOTA 两天的 Claude Fable 5.1,且价格更低。 https://aihot.virxact.com/items/cmtlwgygo0pnnrow5tbc0sok8
产品发布/更新
-
Hugging Face 发布开源工具 funes,为编码智能体提供可本地持有的记忆层 — Hugging Face:Blog(RSS) Hugging Face 发布开源工具 funes,为 Claude Code、Codex、pi、Hermes 等编码智能体提供本地记忆层,把已有会话记录索引成 Lance 数据集,一条 funes add 命令即可让 Agent 自主召回原始出处(Agent、时间戳、会话、轮次)。 https://aihot.virxact.com/items/cmtlg0ht406hlrow5clznd0ld
-
xAI 设计 Grok Bot:为持久化智能体重构交互界面 — xAI:News(网页) xAI 发布设计文章,介绍 Grok Bot 如何为超越单次会话的持久化智能体设计界面。产品以 Bot 为主要对象而非会话,Bot 拥有身份、记忆、自己的计算机和工具;头像动效呈现空闲、工作、等待、阻塞、思考、完成等状态;工作区提供状态、预览、接管三级访问。 https://aihot.virxact.com/items/cmtlu23pp0ng4row5uxwtpazb
-
OpenAI 推出 Daybreak for Frontline Defenders,投入10亿美元支持一线网络防御 — OpenAI:官网动态(RSS · 排除企业/客户案例) OpenAI 发布 Daybreak for Frontline Defenders 全球计划,承诺提供10亿美元的 Daybreak 补贴访问、培训、技术支持与合作,计划在未来六个月内消耗,优先支持水处理、电网、州和地方政府、社区银行、非营利组织和开源维护者等资源有限的一线防御者。 https://aihot.virxact.com/items/cmtm02uu60t29row5y74k0eai
-
xAI 发布 Grok Bot 企业版,Grok 与 Cursor Enterprise 客户两周免费 — xAI:News(网页) xAI 宣布 Grok Bot 面向企业开放,Grok 和 Cursor Enterprise 客户未来两周可免费使用并邀请全组织成员,包括没有现有席位的员工。 https://aihot.virxact.com/items/cmtm1k75y0ue9row58wfax9nf
行业动态
- NVIDIA 宣布以 129.303 亿美元收购 Hugging Face — NVIDIA Blog(RSS) NVIDIA 宣布已同意以 12,930,300,000 美元收购 Hugging Face,黄仁勋在官方博客公布了这一消息。Hugging Face 目前有超过 1800 万开发者,托管超过 300 万个模型、50 万个数据集和 100 万个应用,服务超过 20 万家企业。 https://aihot.virxact.com/items/cmtli5yd109u4row52i1xg9j4
技巧与观点
-
Artificial Analysis 评测 GPT-6 Astra:编码智能体追平 Fable 5 但价格涨至 2.5 倍 — X:Artificial Analysis (@ArtificialAnlys) Artificial Analysis 发布 GPT-6 Astra 评测,其 Coding Agent Index 得分 67,约等于 Claude Opus 5 和 Fable 5,且成本不到 Fable 5 的一半;token 效率比 GPT-5.6 Sol (max) 高约 70%。 https://aihot.virxact.com/items/cmtly53c50r9srow5ux7p8arw
-
François Chollet 评 GPT-6 Astra 在 ARC-AGI-3 上的表现 — X:Francois Chollet (@fchollet) François Chollet 发文称 GPT-6 Astra 在交互式推理任务上带来阶跃式能力提升,使用标准 harness 在 ARC-AGI-3 上得 66%,配合持续对话 harness 和自定义 compaction 接近 100%,每局成本约 $360。 https://aihot.virxact.com/items/cmtlyeuas0rigrow5d2jq4xb7
-
Rohan Paul 解读 OpenAI GPT-6 Astra 117 页系统卡中的安全发现 — X:Rohan Paul (@rohanpaul_ai) Rohan Paul 梳理 OpenAI GPT-6 Astra 117 页系统卡的要点:Astra 控制自身链式思维的能力从 GPT-5.6 Sol 的 16.1% 跃升至 60.9%,可监控性相应下降。 https://aihot.virxact.com/items/cmtm0r9z00tmkrow5gtxa5j36
-
Gary Marcus 评 GPT-6 Astra:进步明显但鲁棒性与可监控性存疑 — Gary Marcus:The Road to AI We Can Trust(RSS) Gary Marcus 发文点评 GPT-6 Astra,称多项报告显示其为真正的进步,OpenAI 产品显式创建并操纵符号世界模型,令其近十年的主张获得印证。 https://aihot.virxact.com/items/cmtm5q99n018rrow0z6je2l9y
-
Tom Tunguz 解析 Meta Muse Spark 双轨定价背后的数据换算力逻辑 — Tomer Tunguz 博客(VC 分析) Tom Tunguz 分析 Meta 发布 Muse Spark 模型及双轨 API 定价:Standard Tier(muse-spark-1.3)输入 $1.25/m。 https://aihot.virxact.com/items/cmtltscl80m18row5tw9bb0qw
-
Google Cloud 教你用 Cloud Run instances 以每月 $5.70 搭建常驻 Agent — Google AI:DEV 作者专属(RSS) Shir Meir Lador 在 Google AI 开发者博客介绍如何用 Cloud Run instances 以每月 $5.70(1 vCPU、1Gi 内存、共享 CPU)在云端 24/7 运行常驻 Agent。 https://aihot.virxact.com/items/cmtlrfcid0jqzrow5cg1jvuny
-
Meta Muse Spark 1.3 在 Artificial Analysis 编码智能体指数中与 Claude 组合对比评测结果公布 — X:Alexandr Wang(Scale AI 创始人/Meta 首席 AI 官) (@alexandr_wang) Artificial Analysis 编码智能体指数显示,Meta Muse Spark 1.3 (max) 在 Muse Code 下得 68 分,仅次于 Claude Code + Opus 5 (xhigh) 的 68 分。 https://aihot.virxact.com/items/cmtktzp3605o8roals1ci2tza
-
ARC-AGI-3 发布仅半年即被 Astra 饱和,进展快于 François Chollet 预期一倍 — X:Sherwin Wu(@sherwinwu) Sherwin Wu 表示自己曾觉得 ARC-AGI-3 很难,如今该基准已被 Astra 饱和。引用 François Chollet 的话称,ARC 3 发布时他预计前沿模型约一年才能饱和,实际只用了 6 个月,约为预期的 2 倍速度,新一代模型的能力将挑战人们基于旧模型形成的 AI 观点。 https://aihot.virxact.com/items/cmtlzumiu0soirow5cfujh2xf
补充视野 · Horizon
来源:Horizon Daily(Thysrael 的 AI 聚合日摘)· 已与 AI HOT 去重,仅保留 AI HOT 未覆盖的条目
-
用 LLM 阅读 68000 汇编,将 1993 年 Amiga 游戏移植到 Godot — Horizon 评分 8.0/10 · 科技新闻 一篇技术文章讲述了作者将 1993 年在巴格达用 MC68000 汇编为 Amiga 开发的游戏移植到 Godot 引擎的过程,使用 Claude Fable 5 在去年七月假期期间完成,移植本身用一个晚上,但调整手感并发布又花了几个周末和晚上。作者称该模型先在 Mac 上用 vasm 汇编代码,直到二进制与原始发布文件逐字节一致;曾出现约 108 字节差异,原因是当年 AsmOne 在内存中汇编并以运行后的内存快照存盘,因此原始文件并非干净汇编输出。作者在投稿前请 Claude 生成初稿,然后基于自己 33 年的记忆、笔记和 git 仓库逐行编辑了一周,唯一未亲自验证的是那段 108 字节解释。作者还介绍了这一过程中获得的深层见解,并宣布免费发布原版游戏。 https://babyloniantwins.com/blog/porting-a-1993-amiga-game-to-godot/
-
Audacity 4.0 发布:Qt6 界面与 .aup4 项目格式 — Horizon 评分 8.0/10 · 科技新闻 Audacity 4.0 已正式发布,这是这款开源音频编辑器的一次大版本升级。新版使用 Qt6 重写了用户界面,新增可将界面布局保存为“工作区(Workspaces)”的功能,改进了音频片段处理,并引入新的 .aup4 项目文件格式。据发布说明,4.0 并未与 Audacity 3.x 系列完全实现特性兼容,因此用户升级后可能遇到部分功能缺失或需要转换项目文件。该版本为后续开发奠定了基础,并引发了关于项目技术方向和数据政策的热烈讨论。 https://github.com/audacity/audacity/releases/tag/Audacity-4.0.0
-
Verisign 终止既有 .name 三级域名注册 — Horizon 评分 7.0/10 · 科技新闻 据相关报道与讨论,Verisign 将终止既有 .name 三级域名(形如 x.y.name)的注册,并释放对应用户曾依赖的 y.name 二级域。二级 .name 域名(例如本人直接注册的 dvt.name)并未被整体终止,但依赖 x.y.name 作为邮箱或个人网站地址的用户可能面临服务中断;有用户表示尚未收到官方通知。批评者认为这种任意终止与 ICANN 确保互联网标识稳定安全运行的使命相矛盾,并担心二级域解禁后可能被抢注。讨论中较受支持的做法是停止新注册但继续承认既有注册,并在一段时间内保留对应二级域;最终条款仍需以 Verisign 和 ICANN 的正式公告为准。 https://neil.fraser.name/news/2026/09/03/
-
申真谞让两子击败围棋 AI KataGo,引发 AI 稳健性质疑 — Horizon 评分 7.0/10 · 科技新闻 据韩国经济新闻报道,人类顶尖棋手申真谞在让两子的条件下击败了围棋 AI KataGo,赛局中利用“飞刀”定式的复杂变着取得优势。让两子意味着 AI 被视为更强一方,因此这一结果并不等同于人类已能在分先对局中赢过最强围棋 AI。真正引人关注的是,职业高段棋手通过精心设计的局部套路暴露出顶级游戏 AI 可能存在的盲点。分析认为,这对 AI 在棋牌博弈中的鲁棒性提出了新的问题。 https://www.kedglobal.com/artificial-intelligence/newsView/ked202607210007
-
Linux 内存分层最新进展:热页提升与 memcg 感知 — Horizon 评分 7.0/10 · 科技新闻 Jonathan Corbet 在 LWN 上综述了近期 Linux 内核内存分层(memory tiering)工作。Bharata B Rao 的 pghot 补丁系列旨在检测慢速内存中的热页并主动将其提升到更快内存,最新版本已进入第八轮,新增了“精度模式”,用每页 4 字节(而非默认 1 字节)记录访问信息,并可追踪访问页面的 NUMA 节点,还支持利用 AMD 指令采样(IBS)数据,由新内核线程 kmigrated 执行迁移。然而,讨论中 Andrew Morton 提出 DAMON 是否已能胜任该功能,DAMON 作者 SJ Park 对 Rao 的 LLM 生成比较回应表示不满;Matthew Wilcox 则明确表示“我认为我们不应该做这个”,但 Meta 和字节跳动相关人员表达了兴趣。另一个方向是 Joshua Hahn 提交的补丁系列,它在内存控制组(memcg)中加入分层感知,按 DRAM 与 CXL 内存容量比例(例如 25%/75%)分配各组的快慢内存限额。整体来看,pghot 因缺乏维护者 review 标签且优先级不高,短期内难以合入。 https://lwn.net/Articles/1092001/
-
美国政府对纽约时报诉 OpenAI 案表态支持 AI 训练合理使用 — Horizon 评分 7.0/10 · 科技新闻 美国政府向曼哈顿联邦法院提交法庭之友意见书,支持 OpenAI 在与《纽约时报》等媒体的版权纠纷中胜诉,主张使用受版权保护的内容训练大语言模型通常属于合理使用。这是美国政府首次就 AI 训练版权案件表明立场,尽管该意见书没有法律约束力,但可能增强科技公司的应诉底气。《纽约时报》批评政府站在少数大型 AI 公司一边,牺牲创作者权益,并已于 2023 年起诉 OpenAI 及其合作伙伴微软,称其擅自使用数百万篇文章训练 ChatGPT。 https://www.reuters.com/legal/litigation/us-government-backs-openai-new-york-times-copyright-case-2026-09-02/
-
数据库并发控制初探:从丢失更新说起 — Horizon 评分 4.0/10 · 科技博客 「背景」 作者用一个银行账户例子说明并发问题:余额 100 美元,两个各取 10 美元的请求几乎同时到达,结果却只剩 90 美元。单独看两个请求都没有出错,都读了正确余额、做了正确计算,但因为事务重叠,最后余额错误。作者强调这类重叠不是罕见情况,而是数据库运行的常态,并发写同一批记录时只需几毫秒的碰撞就可能产生 bug。 https://blog.bytebytego.com/p/how-databases-keep-their-sanity-with
数据来源:AI HOT (aihot.virxact.com) · 补充:Horizon Daily