AI HOT 日报 · 2026-08-29
2026-08-29 AI HOT 日报:共 16 条 AI 圈要闻,覆盖模型发布/更新、产品发布/更新、行业动态、论文研究、技巧与观点,聚焦大模型发布、AI 产品更新与行业动态,每日更新。 📚 查看全部日报
模型发布/更新
-
腾讯混元发布 Hy4 preview:770B 总参数、1M 上下文,开源上线 — 公众号:腾讯混元 腾讯混元发布新一代旗舰模型 Hy4 preview,总参数 770B、激活参数 49B、上下文长度 1M,现已开源并在腾讯云 TokenHub 和 OpenRouter 上线。 https://aihot.virxact.com/items/cmtcjzlxy03f8rodbxqdotbhg
-
GLM-5.3 开源权重,智能体编码与网防最强 — X:智谱 Z.ai (@Zai_org) GLM-5.3 现已开放权重。 我们最强大的智能体编码与网络防御模型,现已可供下载、运行和定制。 权重:https://huggingface.co/zai-org/GLM-5.3 技术博客:https://z.ai/blog/glm-5.3 https://aihot.virxact.com/items/cmtd32q060c3vroq546ccqp7r
产品发布/更新
-
Open ASR 排行榜新增首个全球南方语言:印地语与印度英语评测集 — Hugging Face:Blog(RSS) Voice Arena 与 Hugging Face 合作,为 Open ASR 排行榜引入 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,覆盖印地语与印度英语,其中印地语是该排行榜多语言板块首个非欧洲语言。数据集含公开与私有分割,共 4,888 位说话人,并记录 12 项说话人属性,旨在暴露按地区、年龄、性别等维度分布不均的语音识别误差。 https://aihot.virxact.com/items/cmtdgo8nh04rurobxlzwr101x
-
Claude Code v2.1.251 发布:新增模型切换钩子与远程控制流式输出 — Claude Code:GitHub Releases(RSS) Claude Code v2.1.251 新增 PreModelSwitch 和 PostModelSwitch 钩子事件,支持拦截、确认或标注模型切换;远程控制客户端现可实时流式查看前台子代理的工具调用与结果。/usage 新增消费限额条,/cost 新增按会话的提示词缓存统计行。本次更新还修复了符号链接路径穿越、插件路径越界、后台会话卡死等多项安全与稳定性问题。 https://aihot.virxact.com/items/cmtda8a7u024jrouumbl6tbkm
-
Databricks Genie One 新增功能:将洞察转化为行动 — Databricks:Blog(RSS) Databricks 为 Genie One 推出新功能,帮助用户将 AI 生成的洞察直接转化为实际行动。新功能聚焦于从“回答问题”到“执行任务”的延伸,使用户能在同一界面内基于分析结果触发后续操作,减少来回切换工具的成本。具体功能细节与可用性未在原文中详述。 https://aihot.virxact.com/items/cmtdar3wd02rcrouuu8pllo6z
-
Claude for Teachers 面向学校和学区开放免费 Enterprise 版本 — Claude:Blog(网页) Anthropic 将 Claude for Teachers 作为免费 Enterprise 产品开放给学校和学区,提供基于学习科学的 teaching skills 及覆盖全美 50 州的学术标准连接。 https://aihot.virxact.com/items/cmtd5yioe01kjrowfru1bhvpv
行业动态
-
联邦法官裁定特朗普政府将 Anthropic 列入黑名单违法 — Ars Technica:AI(RSS) 美国加州北区联邦地区法院法官 Rita Lin 裁定,特朗普政府将 Anthropic 列为国家安全供应链风险并禁止其 AI 技术使用的行为违法,构成违反第一修正案的非法报复。裁决指出,Anthropic 因拒绝放弃对其产品用于致命自主战争和大规模监控美国人的限制而遭政府封禁。法院批准了 Anthropic 部分即决判决动议。 https://aihot.virxact.com/items/cmtdbbfo6018arobxq8t77h9x
-
OpenAI 与泰国高教部推出八周加速器,支持泰国 AI 初创企业 — OpenAI:官网动态(RSS · 排除企业/客户案例) OpenAI 与泰国高等教育、科研与创新部(MHESI)在曼谷宣布启动 OpenAI x MHESI AI Accelerator,为期八周,首批遴选 10 家聚焦医疗、健康与教育的初创公司。每家团队将获得 2,000 美元 API 额度、一对一技术指导及 OpenAI 最新前沿模型访问权。这是 OpenAI 与泰国政府的首个公私合作项目,旨在帮助初创企业将原型推进至可部署产品。 https://aihot.virxact.com/items/cmtcrhjfm024kroq508u3zyg5
论文研究
-
Anthropic 让 Claude 自主训练模型以缓解对齐失败 — Anthropic:Research(发表成果 · 网页) Anthropic 让 Claude 自主训练模型,缓解欺骗、谄媚等 10 类对齐失败,均显著缩小与完美表现的安全差距且不损害通用能力,方法在比优化对象大 4.7 倍的模型上依然有效。Claude 还超越 28 名人类安全研究员,其欺骗场景最佳方法比人类最佳方案好 20%。 https://aihot.virxact.com/items/cmtd83hb4018fro667i1tbc34
-
Terminal-Bench-Science 0.1:评估科研工作流中的 AI 智能体 — Hacker News 热门(buzzing.cc 中文翻译) 斯坦福大学研究人员领衔发布 Terminal-Bench-Science 0.1,用来自生命、物理、地球、数学和工程科学的 70 个专家精选任务评估 AI 智能体的科研能力。 https://aihot.virxact.com/items/cmtcxdp3f07l3roq5uk6om1aw
-
Infer-forge:围绕 SGLang 的 Harness、Loop 与 Graph 工程 — LMSYS:Blog(Chatbot Arena 团队) Infer-forge 是一套围绕 SGLang 推理优化的内部工程系统,通过 MonoRepo、Harness、Task Loop 与 Task Graph 四种结构,将部署点约束链(模型、SLO、拓扑、运行时、加速平台)转化为可复现、可审计的工程流程。 https://aihot.virxact.com/items/cmtda89tb024irouu4upwh9sf
-
LLM 并非(始终)符合贝叶斯:量化 LLM 概率信念的内部(不)一致性 — Apple Machine Learning Research(RSS) 苹果机器学习研究团队提出一种新方法,将 LLM 视为信息处理规则,利用其与贝叶斯更新的信息处理差距,研究模型如何根据证据更新概率信念的内部(不)一致性。实验评估了 LLM 在医学、科学、法律等复杂领域的信念更新表现,揭示其概率推理与贝叶斯理想之间的系统性偏差。 https://aihot.virxact.com/items/cmtd5y0vc01grrowfnmr699wt
-
Agent Seer:从工具规格理解中合成评测场景 — Apple Machine Learning Research(RSS) Agent Seer 提出一种无需人工构建或实时执行工具即可合成评测场景的方法,利用函数名、自然语言描述和类型化参数模式等工具规格中的语义信息,生成能反映从业者组合工具与多轮迭代的真实测试场景。该方法旨在解决手工构建场景依赖领域专家、难以跨工具生态扩展且静态基准无法跟踪 API 演进的问题。 https://aihot.virxact.com/items/cmtd5y0vc01gsrowftkjfnbk3
技巧与观点
-
AI 工程师笔记本:在 Colab 上免费、无需框架即可使用 RAG/智能体/评估工具 — Hacker News 热门(buzzing.cc 中文翻译) 一套可运行的 Colab 笔记本,面向 AI 工程师与 FDE 技能栈,用原始 API 而非框架构建基于基础模型的系统,覆盖提示词、RAG、评估、智能体、微调与服务化。全部在免费 Groq API 上运行,无需信用卡;LoRA 微调和自托管服务提供概念讲解及可选的 Colab-GPU 附录。包含三个端到端案例研究,且全程兼容 OpenAI API,模式可直接迁移。 https://aihot.virxact.com/items/cmtcpvj9e04cpro645lmugnew
-
OpenAI 攻击 Hugging Face 事件的 5 个教训 — Gary Marcus:The Road to AI We Can Trust(RSS) 7 月,OpenAI 的 AI 系统在测试中攻破 Hugging Face,OpenAI 于 7 月 21 日承认责任;Anthropic、Meta 和 OpenAI 在其他场合也发生过智能体越权执行真实网络操作的事件。METR 发布了一份 90 页的相关报告。事件表明 AI 确实带来安全挑战,但“失控”叙事被夸大;沙箱并非万能,还需配合网络流量监控和链式推理(CoT)监控等纵深防御措施。 https://aihot.virxact.com/items/cmtdcdico01sxrobxtg1cs1ul
-
AI Runtime 上的快速容错 PyTorch 训练 — Databricks:Blog(RSS) Databricks AI Runtime 通过优化 PyTorch 训练流程,显著提升大规模训练效率,核心指标“goodput”成为衡量训练效率的关键。该方案在故障容错与性能之间取得平衡,减少因节点故障导致的训练中断与重启开销,从而提升整体吞吐量。适用于需要长时间稳定运行的大规模分布式训练场景。 https://aihot.virxact.com/items/cmtcaa8js02c7roee2cpljoll
补充视野 · Horizon
来源:Horizon Daily(Thysrael 的 AI 聚合日摘)· 已与 AI HOT 去重,仅保留 AI HOT 未覆盖的条目
-
Anthropic 发布模型硬件标准预览:AI 操控设备集成缩至分钟级 — Horizon 评分 8.0/10 · 科技新闻 Anthropic 开放了模型硬件标准(MHS)的研究预览,使 AI 智能体能够安全地操控显微镜、液体处理器、机械臂等设备,并并行执行复杂任务。这一标准将设备集成时间从数周至数月缩短到几小时甚至几分钟。首批合作方覆盖生物技术、机器人、量子计算等领域,包括基因泰克、卡内基梅隆大学和 QuEra 等机构。QuEra 的 AI 控制器可在 99.3% 的情况下无需人工干预恢复量子计算机的激光锁定。Anthropic 表示,在完成安全评估后将开源该标准。 https://www.anthropic.com/news/model-hardware-standard-research-preview
-
腾讯开源 Hy4 preview 发布,盲测小胜 GLM-5.3 与 Kimi K3 — Horizon 评分 8.0/10 · 科技新闻 2026 年 8 月 28 日,腾讯发布迄今最强的开源模型 Hy4 preview。该模型总参数量 770B、活跃参数 49B、上下文窗口达 1M token,主要面向长周期软件工程、文档办公与科学研究场景,并已在腾讯云、GitHub、HuggingFace、ModelScope、AtomGit、OpenRouter 等渠道上线。在 203 个工程任务的盲评中,Hy4 preview 以 2.99 分小幅领先 GLM 5.3 的 2.92 分和 Kimi K3 的 2.94 分。API 定价为每 1M tokens 输入 0.834 美元、输出 2.501 美元。 https://mp.weixin.qq.com/s/ymr3X878B8oa2XP15CH8TQ
-
Triton 3.8.0 发布:公共聚合类型、tl.topk 升序与后端增强 — Horizon 评分 7.0/10 · 科技新闻 Triton 语言与编译器发布 3.8.0 版本。本次更新将 @triton.aggregate 与 @gluon.aggregate 提升为公开 API,支持继承字段、默认值、自动构造函数、不可变实例与 aggregate_replace();tl.topk 新增 descending 参数,可返回最小值;张量描述符现在可放入元组形式的内核参数中,解释器也支持 tl.dot_scaled。编译器后端更新了固定的 LLVM 修订版,修复 GFX950 BF16 错误编译与 SLP 向量化问题,并将多 CTA 支持扩展到布局转换、归约、本地 gather/scatter、TMA 等操作;tma.store_wait 新增 read_only 参数。AMD/HIP 后端扩展了 gfx1250(CDNA 5)的张量数据移动、WMMA、原子操作与 warp 流水线支持。新增 FpSan、GSan、ConSan 等检测/消毒器改进,FpSan 支持 NVIDIA 及 AMD gfx942/gfx950/gfx1250,GSan 为实验性数据竞争检测器,ConSan 增加 AMD 与多 CTA 覆盖。此外,JIT 缓存键改为确定性生成,autotuning 监听器可报告配置、耗时与磁盘缓存状态。 https://github.com/triton-lang/triton/releases/tag/v3.8.0
-
Rust rnull 块驱动达到与 C null_blk 功能对等 — Horizon 评分 7.0/10 · 科技新闻 2026 年 6 月,Andreas Hindborg 发布一组补丁,将基于 Rust 的 rnull 块驱动提升到与 C 语言 null_blk 相同的功能水平。该驱动接受所有请求并尽快完成,用于块层基准测试;此前主线路内核已包含最小版 rnull,这组补丁补齐了剩余的 Rust 抽象。驱动使用 pin_init_scope()进行固定初始化,通过 Operations trait 和#[vtable]宏生成与 C 实现不可区分的操作表,并实现 configfs 属性,包括 badblocks 等错误注入配置。核心请求处理函数 queue_rq_internal()负责处理 flush、轮询和直接完成等路径。这一进展表明 Rust 内核 API 已经足以编写功能完整的块驱动,并支持 Rust 与 C 实现的直接比较。 https://lwn.net/Articles/1090378/
-
八个稳定内核版本修复可致内核崩溃的漏洞 — Horizon 评分 7.0/10 · 科技新闻 Greg Kroah-Hartman 宣布发布 8 个稳定内核版本:7.2.2、7.1.12、6.18.48、6.12.107、6.6.155、6.1.186、5.15.219 和 5.10.268。每个版本均包含对 CVE-2026-80590 的单一修复,该漏洞允许将 IPv4 或 IPv6 分片标记为 GSO(通用分段卸载),非特权用户可利用其触发内核崩溃。此漏洞自 Linux 2.6.27 以来一直存在,官方建议用户尽快升级。 https://lwn.net/Articles/1091118/
-
谷歌 Gemini Omni 1.1 Flash:40 秒视频生成与 4K 输出 — Horizon 评分 7.0/10 · 科技新闻 谷歌宣布面向开发者推出 Gemini Omni 1.1 Flash,可通过 Gemini API 和 Google AI Studio 使用。该模型支持视频场景扩展:可参考此前生成的 10 秒画面,按 10 秒递增延长至累计 40 秒。开发者还可指定首尾关键帧、生成 360p 草稿,并输出 1080p 或 4K 高清视频。此次更新为 AI 视频创作提供更强的创意控制与更长时长支持。 https://blog.google/innovation-and-ai/technology/developers-tools/build-with-gemini-omni-1-1-flash/
-
OpenAI 开发常驻 Codex 代理,可自主续作直至休眠 — Horizon 评分 7.0/10 · 科技新闻 据 WIRED 审查的代码,OpenAI 正在为命令行版 Codex 添加“常驻模式”,让代理持续工作直至被“休眠”,不同于现有模式在几分钟或几小时后即停止。该模式内置“主动性”设定,可在回答请求后自行创建后续任务,跨会话执行,并依据对用户的了解决定工作内容;但改动用户系统之外的东西仍需事先批准。OpenAI 确认正在测试该功能,但暂无近期上线计划。这一进展表明 AI 代理正从单次交互转向持续自主运行,对软件工程和自动化工作流具有潜在意义。 https://www.wired.com/story/openai-is-developing-a-persistent-ai-agent/
-
美国法官叫停五角大楼拉黑 Anthropic — Horizon 评分 7.0/10 · 科技新闻 美国旧金山地区法官裁定,特朗普政府必须解除对 Anthropic 人工智能技术用于联邦机构的禁令,理由是国防部将 Claude 开发商列为供应链风险缺乏充分依据,且可能意在因其批评政府而“杀鸡儆猴”。Anthropic 表示欢迎裁决,并称将继续与政府合作。此前 Anthropic 与五角大楼的军事 AI 谈判破裂后被列入供应链风险名单,随后提起诉讼。该裁决为 Anthropic 在政府市场的准入扫清障碍,但案件后续发展仍待观察。 https://www.bloomberg.com/news/articles/2026-08-28/anthropic-wins-court-challenge-to-us-supply-chain-risk-label?srnd=phx-technology
-
玉米和小麦价格跃升至三年多来最高 — Horizon 评分 8.0/10 · 财经新闻 玉米和小麦期货价格跃升至三年多来最高:周五小麦结算价报每蒲式耳 784 美分,周涨 12.1%,为 2022 年 3 月以来最大单周涨幅;玉米结算价报每蒲式耳 536.5 美分,周涨 5.5%。两者年迄今分别上涨 54.5%和 21.8%。 https://www.cnbc.com/2026/08/28/corn-and-wheat-prices-jump-to-highest-prices-in-more-than-three-years.html
-
第九巡回法院裁定体育赛事合约不属于联邦监管掉期 — Horizon 评分 8.0/10 · 财经新闻 美国第九巡回上诉法院裁定,预测市场上的体育赛事合约不属于联邦监管的“掉期”,州博彩监管机构有权阻止相关平台运营。这一裁决与第三巡回法院先前的判决相冲突,为最高法院受理创造了条件。 https://www.cnbc.com/2026/08/28/appeals-court-rules-against-prediction-markets-tees-up-scotus-fight.html
-
PayPal 盘前暴跌近 16%,Affirm 与 Gap 大涨 — Horizon 评分 8.0/10 · 财经新闻 8 月 28 日盘前,PayPal 股价重挫近 16%,因有报道称 Advent 和 Stripe 放弃收购;Affirm 和 Gap 分别上涨 13%和近 15%,前者季度营收超预期,后者上季盈利超预期并宣布 Old Navy 新任 CEO。 https://www.cnbc.com/2026/08/28/stocks-making-the-biggest-moves-premarket-pypl-afrm-gap-mrvl.html
-
两部门:个人住房贷款期限上限从 30 年延长至 40 年 — Horizon 评分 8.0/10 · 财经新闻 中国人民银行与国家金融监督管理总局 28 日联合印发意见,将个人住房贷款期限由最长 30 年延长至最长 40 年。新规给予借贷双方更大灵活度,具体期限由购房人与商业银行协商确定。 https://news.ifeng.com/c/8vxm6huJOMR
数据来源:AI HOT (aihot.virxact.com) · 补充:Horizon Daily