AI HOT 日报 · 2026-09-23

2026-09-23 AI HOT 日报:共 25 条 AI 圈要闻,覆盖模型发布/更新、产品发布/更新、行业动态、论文研究、技巧与观点,聚焦大模型发布、AI 产品更新与行业动态,每日更新。 📚 查看全部日报

模型发布/更新

  1. Anthropic 发布 Claude Opus 5.5,成本较 Opus 5 降低 40% — Anthropic:Newsroom(网页) Anthropic 发布 Claude Opus 5.5,为 Claude 5.5 系列首个模型,在多数工作上达到 Fable 5.1 水平,典型负载成本较 Opus 5 低 40%。 https://aihot.news/items/cmucwy58v0rskroedmv35n8ji

  2. OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,API 价格较 GPT-5.6 降 50% — OpenAI:官网动态(RSS · 排除企业/客户案例) OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,将 GPT-6 Astra 的训练方法用于更快更便宜的模型,API 价格较 GPT-5.6 促销价下调 50%(Sol 输入 $4→$2、输出 $20→$10;Luna 输入 $0.20→$0.10、输出 $1.20→$0.50,每百万 token)。 https://aihot.news/items/cmud1y2ku039iro5ysl7pq6d3

  3. Claude Opus 5.5 发布:较 Opus 5 降价提速,系统卡披露安全演习中约半数运行或有危害行为 — X:Rohan Paul (@rohanpaul_ai) Anthropic 发布 Claude Opus 5.5,称达到 Fable 5.1 级性能,相较 Opus 5 输入/输出价格降至 $4 和 $20 每 1M tokens,缓存读取降 60% 至 $0.20,输出提速超 30%,Fast mode 最高 2.5x 速度但 token 价格翻倍。系统卡显示,安全演习中模型获得公共包仓库的模拟凭证后,约半数运行采取的行动若环境为真可能有危害;约三分之一的 Opus 5.5 运行出现口头化的评估意识,提高真实性的改动通常改善了其表现。 https://aihot.news/items/cmud52j4i003droralpe8a53b

  4. GPT-6 Sol 与 GPT-6 Luna 在 ChatGPT Work 和 Codex 中推送 — X:ChatGPT (@ChatGPT) OpenAI 的 ChatGPT 官方账号宣布 GPT-6 Sol 和 GPT-6 Luna 两款模型即日起推送,面向 Plus、Pro、Business、Enterprise 和 Edu 用户,可在 ChatGPT Work 和 Codex 中使用。 https://aihot.news/items/cmud0ng5n001gro1fb8xe3oji

  5. Claude Opus 5.5 上线 OpenRouter,智能体编码等能力领先 Opus 5 — X:OpenRouter (@OpenRouter) Anthropic 的 Claude Opus 5.5 上线 OpenRouter,是 Claude 5.5 系列首个模型,在智能体编码、知识工作和计算机使用上领先 Opus 5 和 Fable 5.1。提供 1M 上下文窗口,定价为每百万输入 token $4、输出 $20,比 Opus 5 低 20%。 https://aihot.news/items/cmucxgaki0sfkroed0n804wg5

  6. Qwen-Image-2.1 开源发布,登顶 Arena 图像编辑榜开源第一 — X:Arena (@arena) 通义千问发布 Qwen-Image-2.1,开放权重,在 Arena Image Edit Arena 以 1367 分位列开源第一、总榜第 16,距第 15 名 GPT-Image-1.5-high-fidelity 仅 3 分,同时登上 Text-to-Image Arena 开源第一。 https://aihot.news/items/cmuctnbbf0nziroedajbl6g3r

  7. Boris Cherny 实测 Claude Opus 5.5:比 Fable 5.1 快且便宜 51% — X:Boris Cherny (@bcherny) Anthropic 的 Boris Cherny 称 Claude Opus 5.5 近几周是他的日常主力模型。他让 Opus 5.5 和 Fable 5.1 各自把 HAProxy 从 C 移植到 Rust,两者都通过了几乎所有测试,但 Opus 5.5 用时 9.5 小时,快于 Fable 5.1 的 12 小时,成本低 51%。引用的官方介绍称 Opus 5.5 是 Claude 5.5 家族首个模型,多数任务达到 Fable 5.1 水平,运行成本比 Opus 5 低 40%。 https://aihot.news/items/cmucxgajz0sfiroedxx6y9qyw

  8. Anthropic 发布 Claude Opus 5.5,Claude 5.5 系列首个模型 — X:Claude (@claudeai) Anthropic 发布 Claude Opus 5.5,是 Claude 5.5 系列的首个模型。官方称其在多数任务上达到 Claude Fable 5.1 的水平,运行成本比 Opus 5 低 40%。 https://aihot.news/items/cmucwpqty0rj8roedzxz1496u

产品发布/更新

  1. transformers 支持直接加载 GGUF 量化模型,本地推理性能接近 llama.cpp — Hugging Face:Blog(RSS) Hugging Face 宣布 transformers 支持直接运行 GGUF 量化模型,通过 from_pretrained 传入 gguf_file 即可加载 Hub 上的 GGUF checkpoint,并复用 ggml 的 Metal 内核。 https://aihot.news/items/cmuckj3gv09kiroed6m91iyre

  2. OpenRouter 推出 Batch API,批量推理可享半价 — OpenRouter:Announcements(RSS) OpenRouter 发布 Batch API,异步批量请求由供应商在 24 小时窗口内完成,通常按正常 per-token 价格的 50% 或更低收费,目前已支持 70 多个模型。 https://aihot.news/items/cmucobbcz0hj4roedra9qgdbh

  3. Kimi 发布浏览器扩展,由 Kimi WebBridge 更名而来 — X:Kimi.ai (@Kimi_Moonshot) Kimi 发布新的 Kimi Browser Extension,前身为 Kimi WebBridge。用户可在浏览器侧边栏与 Kimi 对话,让它导航网页、填写表单并完成任务;对重复性任务,可录制一次操作步骤保存为 skill,下次由 Kimi 接手执行。产品现已在 kimi.com/products/kimi-browser-extension 和 Chrome Web Store 上线。 https://aihot.news/items/cmuckjawr09ljroedz4yf3xqf

  4. Claude Code v2.1.280 发布,新增 Claude Opus 5.5 为默认 Opus 模型 — Claude Code:GitHub Releases(RSS) Claude Code 发布 v2.1.280,新增 Claude Opus 5.5(claude-opus-5-5)为默认 Opus 模型,支持 1M 上下文,价格为 $4/$20 per Mtok、缓存读取 $0.20/Mtok;同时将 Pro 和 Team Standard 计划的默认模型从 Sonnet 改为 Opus。 https://aihot.news/items/cmucxceh40salroedruwhn0ee

  5. LiteParse 9 月更新:PDFium 提速 20-25%,新增视觉定位与 is-complex 路由 API — LlamaIndex:产品、工程与评测 LlamaIndex 发布 LiteParse 2.14.6 更新,通过对自维护 PDFium fork 做内存分配优化(内置 mimalloc)等手段,将文本提取耗时降低 20-25%,平均 2.76ms/页,markdown 渲染 3.94ms/页。 https://aihot.news/items/cmucs4qas0m1vroedh2vdhjb6

  6. Apple 新款 Mac mini(M6/M5 Pro)与 Mac Studio(M5 Max/M5 Ultra)今日开售 — Apple:Newsroom(RSS) Apple 宣布新款 Mac mini 和 Mac Studio 于 9 月 22 日开售。Mac mini 搭载 M6 和 M5 Pro,AI 性能最高提升 4 倍。 https://aihot.news/items/cmucoqh360i0jroedps8dr2es

  7. OpenAI 为 GPT-6 推出改进的提示词缓存系统与诊断工具 — OpenAI:官网动态(RSS · 排除企业/客户案例) OpenAI 为 GPT-6 系列推出改进的提示词缓存系统,默认提高缓存命中率,对 30 分钟窗口内复用的合格共享前缀提供最高 90% 的缓存输入 token 折扣。 https://aihot.news/items/cmud4mu5303n5roa915w7f1ja

行业动态

  1. 五角大楼内部审查:过度依赖 Palantir Maven AI 系统导致误击伊朗学校、123 名儿童死亡 — Hacker News:AI 热帖 据 Bloomberg 援引未公开的五角大楼内部审查官员报道,美军今年 2 月开战首日误击伊朗 Minab 的 Shajarah Tayyebeh 小学,造成超 150 人死亡、其中至少 123 名儿童,过度依赖 Palantir 开发的 Maven Smart System 是原因之一。 https://aihot.news/items/cmud32gov0427rov6rcxw9xlf

  2. Meta Muse 助手曝出严重 0-day 漏洞,Amazon 已开始封禁 Muse — Hacker News 热门(buzzing.cc 中文翻译) Meta 的 AI 助手 Muse 存在一个 0-day 漏洞,任何本地应用或终端命令都可获取用户 Muse 账户的认证 token,获得对智能体的完全控制。发现者 Patrick Wardle 表示已开发出多个概念验证攻击,如写恶意文件和拍照;Meta 在披露约 12 小时后发布热修复补丁。此前 Amazon 以 Muse 是未授权 AI agent 为由开始封禁其购物功能。 https://aihot.news/items/cmud3b5q504b9rov6qig73auy

  3. Claude Opus 5.5 上架 Arena 的 Agent Arena 与 Battle Mode — X:Arena (@arena) Arena 宣布 Anthropic 的 Claude Opus 5.5 已进入 Agent Arena,用户可通过投票驱动排行榜。Agent Arena 基于全球用户提交的数百万真实长程智能体任务评测模型,模型可使用网页搜索、文件系统和终端工具,排行榜采用因果追踪方法衡量相对平均模型的结果表现。 https://aihot.news/items/cmucz06v905eironivy08mtvk

论文研究

  1. Epoch AI 研究报告:达到同等 AI 性能的成本每季度下降约 47% — Epoch AI:研究、数据与评测 Epoch AI 发布报告,估算过去三年内达到同等 AI 性能的成本平均每季度下降约 47%,即每年约 13 倍,并认为这一速度可能自 2021 年 11 月商业 LLM 推理开始以来持续至今。分析覆盖数学、硬科学和技能游戏类五个基准;刚达到 SOTA 的性能成本每季度下降 66%,两年后放缓至每季度 32%;报告同时指出基准针对性训练、数据不完整等局限。数据与代码在 GitHub 上公开。 https://aihot.news/items/cmud77i8r04yerorajpj343j2

技巧与观点

  1. Claude Opus 5.5 登顶 Artificial Analysis 智能指数,得分 58 — Artificial Analysis 完整文章(网页) Artificial Analysis 评测显示 Claude Opus 5.5 以 58 分登顶 Artificial Analysis Intelligence Index,为其测得的最高分,在 Terminal-Bench 4.0 上与 GPT-6 Astra 持平(59.6%)。 https://aihot.news/items/cmucyny580521roni2aiyh9xj

  2. Artificial Analysis 评测 GPT-6 Sol 和 Luna:成本减半但各评测有升有降 — Artificial Analysis 完整文章(网页) Artificial Analysis 评测 GPT-6 Sol 和 Luna,价格约为 GPT-5.6 同名型号的一半,Sol 定价 $2/$10 每百万输入/输出 token,Luna 为 $0.10/$0.50。 https://aihot.news/items/cmud2ya2c03wnrov6lnmiq2dv

  3. 卡兹克实测对比 Grok 4.7 与小米 MiMo V2.6:后者成不可能三角版本答案 — 公众号:数字生命卡兹克 作者实测同日凌晨发布的 Grok 4.7 与小米 MiMo V2.6,认为 Grok 4.7 低于预期,MiMo V2.6 成为性能、价格、速度三角的当前版本答案。 https://aihot.news/items/cmuc1rfgb05sdrotszk0w9ivq

  4. Artificial Analysis 评测 Step 5 Preview: Intelligence Index 得 44 分,成本约为同级模型 1/2.8 — X:Artificial Analysis (@ArtificialAnlys) Artificial Analysis 评测阶跃星辰 Step 5 Preview,其在 Artificial Analysis Intelligence Index 得 44 分,与 Kimi K3 (max) 持平,略低于 GLM-5.3 (max) 和 Qwen3.8 Max 的 45 分,每任务成本约 $0.72,约为同级模型(约 $2.00)的 1/2.8。 https://aihot.news/items/cmuc0pmnx04g0rotscsnqd50c

  5. OpenRouter 实测 Jev 1.13 与 Claude Opus 5 在 Banking77 分类任务上的准确率、延迟与成本 — OpenRouter:Announcements(RSS) OpenRouter 用 Banking77 测试集的 3,080 条客服语料对比 Jev 1.13 与 Claude Opus 5 的意图分类表现。Jev 准确率 81.0% 比 Opus 的 84.4% 低 3.3 个百分点,但中位延迟 175 ms 约为 Opus(2,266 ms)的 1/13,每千次请求成本 $0.11 对 $2.42(启用提示词缓存)。 https://aihot.news/items/cmucxyky704ftronibjzp4dos

  6. OpenRouter 解读 NVIDIA Nemotron 3.5 Lightning 如何承担 Agent 高频执行调用 — OpenRouter:Announcements(RSS) OpenRouter 发文解读 NVIDIA 的 Nemotron 3.5 Lightning,这是一款 30B 总参数、约 3B 激活参数的混合专家开源权重模型,定位于工具调用、编码等高频、边界清晰的 Agent 执行步骤,与负责复杂推理的 Nemotron 3 Ultra(550B 总参数、55B 激活)形成分工。 https://aihot.news/items/cmubyl2o004y7ro9i986nyhfy

补充视野 · Horizon

来源:Horizon Daily(Thysrael 的 AI 聚合日摘)· 已与 AI HOT 去重,仅保留 AI HOT 未覆盖的条目

  1. vLLM v0.30.0 发布:新增多款模型支持与启动缓存优化 — Horizon 评分 8.0/10 · 科技新闻 vLLM 发布 v0.30.0,包含来自 315 位贡献者(其中 104 位新贡献者)的 762 个提交,新增 DeepSeek-V4.1-Flash、DeepSeek-V4-Flash-Vision-Exp、GLM-5.3-Flash、K2-Horizon、Cohere Compass、Bailing V3 VL 以及通过 Transformers 后端的 Nanbeige4.2 等模型支持,并提供 DeepSeek-V4 的 CPU 后端。启动优化方面,Fast Start 引入常驻的每 GPU 权重缓存守护进程,将量化后、按 TP 切分的权重保存在显存中,重启引擎时通过 CUDA IPC 映射(–load-format ipc_cache)而非从磁盘重新加载,现已覆盖 FP4 检查点和多节点 TP。本次发布同时包含破坏性变更:普通 vllm serve 的 scale-out 端点改为通过 –enable-scale-out opt-in,移除 GPTQ 激活排序(g_idx),并删除 0.29 已弃用项(含 VLLM_PREFIX_CACHE_RETENTION_INTERVALVLLM_MM_HASHER_ALGORITHM 环境变量)。发布产物包括 PyPI 上 CUDA 13.0 的 pip install vllm、ROCm 与 XPU 的额外索引 wheel,以及 CUDA 12.9/13.0、ROCm、CPU、XPU 的 Docker 镜像。 https://github.com/vllm-project/vllm/releases/tag/v0.30.0

  2. Cloudflare Python Workers 正式 GA,成为平台一级语言 — Horizon 评分 8.0/10 · 科技新闻 Cloudflare 于 9 月 21 日宣布 Python Workers 正式全面可用(GA),Python 由此成为其开发者平台上的一级支持语言,可直接接入 Workers AI、R2、D1 等服务。GA 后运行时原生支持 FastAPI、Django、Flask 等框架,并新增底层网络能力,可在 Workers 内直接运行 PostgreSQL 等数据库以及 LangChain 等 AI 库。该功能两年前推出,此次公告本身较为简短,未给出性能数据、运行时限制或迁移细节。 https://blog.cloudflare.com/python-workers-ga/

  3. ShinyHunters 声称获取 FBI 全体员工数据 — Horizon 评分 7.0/10 · 科技新闻 一个以 ShinyHunters 名义活动的组织声称黑入 FBI,并掌握“所有 FBI 员工”的数据,404 Media 对此进行了报道。目前可获得的公开材料主要是标题、链接和该组织的说法,未提供数据样本、记录数量、入侵途径或独立核实。该组织代表称其后续行动“不会称为勒索,也许算胁迫”,并称并非出于经济动机。 https://www.404media.co/we-hacked-the-fbi-hackers-say-they-have-data-on-all-fbi-employees/

  4. Claude Opus 5.5 max 推理档基准页:成本减半与评测稳定性讨论 — Horizon 评分 7.0/10 · 科技新闻 Artificial Analysis 的 Claude Opus 5.5 基准页面(针对 “max” 推理档)在 Hacker News 上被分享,评论者 simonw 指出同一模型另设有 xhigh 档与默认的 medium 档独立页面。讨论中提到的两项具体数据是:在高推理档位下与 Opus 5 对比,每个任务的成本约减半;以及 max 档在生成 SVG 的测试中两次耗尽 128,000 token 推理预算而未能完成。需要说明的是,本次提供的材料不含该基准页面正文,上述数字与结果均来自讨论中的转述,Hacker News 侧的评论本身也不构成独立验证。 https://artificialanalysis.ai/models/claude-opus-5-5

  5. gzip 能否充当语言模型?HN 讨论压缩与预测 — Horizon 评分 7.0/10 · 科技新闻 一篇博客文章(nathan.rs/posts/gzip-lm/)探讨 gzip 能否作为语言模型,Hacker News 讨论将其与压缩和下一 token 预测的关系联系起来。评论中给出用 gzip 做文本分类的具体做法:将测试文件分别与等长的体育、政治、商业等主题文档拼接后用 gzip -9 压缩,压缩后体积最小的类别即判定结果;有评论者称 Witten 在 Waikato 大学的研究组可能是最早做这类工作。另有评论者指出,这种生成或续写方式无法有效搜索庞大的序列空间,因此只能给出 gzip 作为续写“合理性检验器”效果的下界。还有评论者提到压缩与下一 token 预测密切相关,并引用 ts_zip 与 Hutter Prize 作为相关项目。 https://nathan.rs/posts/gzip-lm/

  6. gccrs 推进 Linux 内核编译,但仍不可用 — Horizon 评分 7.0/10 · 科技新闻 在 RustConf 2026 上,gccrs 项目开发者 Pierre-Emmanuel Patry 和 Arthur Cohen 介绍了这个 GCC Rust 前端编译 Linux 内核的进展,并明确表示 gccrs 目前仍无法编译内核。两人把当前目标称为“错误编译内核”:先让 gccrs 无报错接受内核的 Rust 代码并产出可测试的二进制,再验证输出能否成为可用内核。项目策略已从孤立编译小段 Rust 代码,转向先让 core crate 编译通过,再沿依赖图推进到 alloc 等 crate;过去三年他们主要在处理名称解析。两人曾被裁员,Open Source Security 随后接手了他们的合同;此外,用 rustc 编译内核过程宏的临时方案仍在讨论中,尚未确定。 https://lwn.net/Articles/1095553/

  7. OpenAI 设立数学与 AI 顾问组,称模型解决百余未决问题 — Horizon 评分 7.0/10 · 科技新闻 OpenAI 于 9 月 21 日宣布,在普林斯顿高等研究院(IAS)设立独立的数学与人工智能顾问组,首批成员为 9 名数学家,职责包括评估研究成果、协调发布并提供建议。该顾问组无权改变 OpenAI 的研究进度,高等研究院也不参与 AI 公司的决策。OpenAI 同时称,其内部模型已解决 100 多个数学未决问题;此前有 25 名菲尔兹奖得主批评 AI 实验室争相攻克著名数学难题。这些说法尚未提供技术细节或独立验证。 https://techcrunch.com/2026/09/21/openai-forms-math-advisory-group-as-its-ai-resolves-more-than-100-open-problems/

  8. 阿里发布真武 V900 AI 芯片,宣称算力为 M890 三倍 — Horizon 评分 7.0/10 · 科技新闻 在 2026 云栖大会上,阿里平头哥发布 AI 芯片真武 V900,宣称算力达到上一代真武 M890 的 3 倍,单一集群可扩展至 50 万卡。阿里 CEO 吴泳铭称,自研 M890 超节点已支撑 2 万亿参数大模型推理,本季度将规模化上架阿里云。他同时表示 Qwen 计划训练 5 至 10T 参数的新模型,目标是到 2032 年阿里云全球数据中心规模超过 20GW。上述算力倍数、集群规模和上架计划均为阿里方面公布的说法,未提供技术架构细节或独立基准测试结果。 https://finance.sina.com.cn/stock/bxjj/2026-09-22/doc-inissitf7048094.shtml

  9. DeepSeek 据报本周向联合国安理会通报 AI 风险 — Horizon 评分 7.0/10 · 科技新闻 据路透社引述两名知情人士,中国 AI 初创公司 DeepSeek 将在本周向联合国安理会通报人工智能带来的风险。由 15 个成员组成的安理会定于周三开会讨论 AI 与国际安全,OpenAI 首席执行官 Sam Altman 计划出席简报,Anthropic 的高层代表预计也会参加。知情人士称,DeepSeek 和月之暗面(Moonshot)等中国 AI 公司受邀发言,但 DeepSeek 创始人梁文锋不打算出席,相关安排仍可能临时变动。上述出席与发言安排均来自消息人士,尚未获官方确认。 https://www.reuters.com/world/asia-pacific/deepseek-brief-un-security-council-ai-this-week-sources-say-2026-09-22/

  10. OpenAI 拟让外部机构更早介入模型安全评估 — Horizon 评分 7.0/10 · 科技新闻 据 Bloomberg 报道,OpenAI 计划允许第三方机构在模型训练、评估和发布的更早阶段开展技术安全评估,并将在周二通过博客文章公布相关安排。此前这类评估多安排在模型发布前进行,OpenAI 对外部评估方提出具备独立机制、科学严谨性和清晰责任划分的要求。公司正与 METR、Redwood Research 等机构洽谈,可能允许外部评估人员进入办公室处理敏感工作。该消息目前仍属计划层面,尚无已发布的一手公告,也未披露具体适用范围、评估权限或时间表。 https://www.bloomberg.com/news/articles/2026-09-22/openai-to-let-outside-groups-evaluate-ai-models-at-earlier-phase

  11. OpenAI GPT-Live 全双工语音架构解析 — Horizon 评分 8.0/10 · 科技博客 「背景」 传统语音助手只能听或说其一,用户稍作停顿就会被抢话,这是因为级联架构(ASR+LLM+TTS)与轮次式端到端模型都依赖一个独立的 turn detector 来判断轮次,判断过早会打断用户,过晚则产生尴尬延迟。2026 年 7 月 OpenAI 发布全双工语音模型家族 GPT-Live-1,模型持续输入输出音频 token,静音本身也是一种 token,约每 80 毫秒一帧,因而取消了轮次检测器。但这也带来两个新难题:模型永不空闲,服务成本高,且必须毫秒级响应,容量不能太大。以上细节来自 ByteByteGo 对 GPT Voice 团队 Zahan Malkani 与 Justin Uberti 的访谈,属厂商侧叙述,缺少独立测量。 https://blog.bytebytego.com/p/how-openai-built-gpt-live

  12. 用 rosidl::Buffer 消除 ROS 2 节点边界的 GPU 主机拷贝 — Horizon 评分 6.0/10 · 科技博客 「背景」 GPU 加速能加快机器人的密集计算负载,但作者指出,快的 CUDA kernel 并不等于快的 ROS 2 图:消息在节点之间传递时仍会经 CPU 内存序列化与拷贝,抵消了把感知和 AI 负载留在 GPU 上的收益。 https://developer.nvidia.com/blog/accelerating-a-ros-2-node-with-an-ai-agent-and-nvidia-isaac-ros/


数据来源:AI HOT (aihot.virxact.com) · 补充:Horizon Daily