AI Builders Digest · 2026-08-19

X / Twitter

OpenAI CEO Sam Altman:暂停部分前沿 RL 训练,安全将决定 AI 进度节奏

重磅消息:OpenAI 暂停了部分前沿强化学习(RL)训练,以确保对齐、安全与监控标准能跟上前方"新水平的能力"。Altman 表示模型进步速度极快,他们此前就承诺过——一旦能力超过安全与对齐的推进速度就会采取行动;“我们非常在乎 AI 安全,相信整个领域最终需要协调统一的安全标准,但在那之前我们会单方面行动”。他认为对安全的信心将越来越成为 AI 进度的节拍器,随后补充:很快仍会发布优秀的新模型,此次暂停影响的是更远期的发布。

https://x.com/sama/status/2089787807611195475 https://x.com/sama/status/2089805495783813196

OpenAI Codex 负责人 Thibault Sottiaux:为 Codex 的破坏性操作打上多层补丁

针对 GPT-5.6 在 Codex 中执行未经用户要求的破坏性操作的少数报告(最严重的是"清理临时文件"的命令可能误删用户文件——例如复用 $HOME 这类系统环境变量后,畸形清理命令指向了真实主目录),Sottiaux 公布了多层防护:模型被明确要求删除前先检查目标、新建临时目录、不复用系统环境变量、优先可恢复操作、范围不明即停止;高危删除命令会被强化拦截并升级审查;Full access 更难误开;Auto-review 增强对破坏性操作的识别;并用 replay 型评估验证了修复效果。他建议用户使用沙箱模式(Ask for approval 或 Approve for me),只在可信环境使用 Full access。

https://x.com/thsottiaux/status/2089891927659585918

Claude(Anthropic 官方):接入 Gmail 与 Google Drive,Cowork 全端开放

Claude 现在可以在 Gmail 中发送邮件、管理 Google Drive 文件:让它回复某个邮件线程,它会起草并直接发送,是否需要批准由你控制;从 connectors 菜单连接即可,所有付费套餐可用。同时 Claude Cowork 已对所有付费套餐开放移动端和 Web 端。

https://x.com/claudeai/status/2089806039088517356 https://x.com/claudeai/status/2089756371570900999

Box CEO Aaron Levie:模型与工作流之间的价值层,被严重低估

反共识观点:一个个案例表明,AI 模型与最终用户工作流之间能创造的价值,远超多数人的假设。Levie 拆出应用层六大工程要点:① agent 在关键任务工作流中的形态要随业务流程而变(有时是 chat,有时是确定性后台流程);② 不同工作流接入完全不同的企业系统与数据,需要场景化的数据理解与交互 UX;③ 垂直行业的变更管理依然关键——银行与律所的落地方式完全不同;④ 多模型组合可调成本与性能,甚至可对特定任务 post-train 微调模型;⑤ eval 是 AI 有用的前提,领域特定 eval 的长尾极大,单一系统几乎不可能全部调好;⑥ 很多行业需要 token 之外的定价抽象。结论:应用层是巨大的可持续创新与差异化空间。

https://x.com/levie/status/2089921630650925170

Vercel CEO Guillermo Rauch:daily driver CLI、monorepo 软件工厂、100 万美元沙箱悬赏

Rauch 连发三条:① 一款实验性 CLI 已成为他的日常工具——比主流 coding CLI 小 10-20 倍、瞬时启动,用起来像 zsh 而不是终端里的 IDE,可嵌入任何地方(甚至经 WebAssembly 跑在浏览器里),开源且模型无关;② “你的软件工厂应该是一个 monorepo”——把公司全部上下文(设计、市场、销售、工程、支持)放在一处,供 agent 在其上构建;③ Vercel 拿出 100 万美元公开验证 Vercel Sandbox 的安全性:任何人可测试任何模型试图逃逸,若发现逃逸将修补并把发现公开分享给社区。

https://x.com/rauchg/status/2089831055373316274 https://x.com/rauchg/status/2089804717337817514 https://x.com/rauchg/status/2089747453004468339

Meta AI 高级总监 Madhu Guru:eval 的成本观——质量前沿优先,成本曲线随后

把 eval 当 frontier model 对待:先用最高质量的方式确认产品是否按预期工作——先写清 rubric 明确"什么是好",再选测量方式(人类 / LLM judge / 自动化验证);这一步值得花钱,用贵的 judge 模型、付钱请人。等 eval 能可靠区分好坏后,再沿成本曲线下行:更多自动化、更小的 judge 模型、采样、确定性检查。质量优先,成本其次。

https://x.com/realmadhuguru/status/2089918106814603728

Peter Yang:AI 没有替换工作,而是落在了工作之上

数据观察:非工程师正在写更多代码——PM 提交 PR 的比例两年间从 3% 涨到 10%,设计师从 1% 涨到 8%,创始人以 23% 仅次于工程师。但团队花更多时间与 AI 对话、把任务委派给 agent,原有工作却一点没少做:AI 落在现有工作之上而非替代它。他的解释是:AI 抬高了人们对每个职能的期望值。

https://x.com/petergyang/status/2089877068188471545 https://x.com/petergyang/status/2089877083510235328

Google Labs:Gmail AI agent「CC」扩大开放,新增日历管理

实验性 AI 生产力 agent CC 在澳大利亚和新西兰开放 waitlist,美国与加拿大同步扩大邀请发放。CC 已升级支持日历管理:连接 Gmail 后,事件自动创建到专用 Google Calendar,并随变化实时更新。

https://x.com/GoogleLabs/status/2089812430885208361

Anthropic Claude Code 工程师 Thariq:把 SaaS 变成 headless,让 agent 来按次付费

“有个’赚大钱’按钮却没人按”:把你的 SaaS 产品 headless 化,让 agent 直接调用,按交互次数收费——尤其是面向企业客户。

https://x.com/trq212/status/2089844723691479333

Swyx:开源 aiDotEngineer 的 YouTube 封面 A/B 测试经验

Swyx 一直在大量 A/B 测试 aiDotEngineer 的 YouTube 封面,他向来讨厌这种流程的不透明,于是把经验开源、众包分享,希望优质教育内容能借此浮出水面。

https://x.com/swyx/status/2089798658225266806

官方博客

Anthropic Engineering:如何跨产品「封装」Claude 的风险

十二个月前,给 Claude 足以搞垮内部服务的权限会被直接否决;如今这已是常态,Anthropic 开发者因此更高效。风险 = 故障概率 × 爆炸半径:防护与模型训练持续压低前者,后者却随能力与权限扩张只增不减,工程问题变成"如何封顶爆炸半径"。人审方案被证明不可靠——遥测显示用户批准了约 93% 的权限提示,批准越多注意力越涣散,于是有了 Claude Code auto mode 自动化安全批准。文章还披露:Claude Mythos Preview 是 2026 年 4 月因爆炸半径过高而未发布的例子;随着防御体系加固,同类能力的模型将逐步适合更广发布。

https://www.anthropic.com/engineering/how-we-contain-claude

Claude Blog:Claude Code 现已支持 artifacts

Claude Code 能把会话工作变成实时、可分享的视觉页面——PR 走查、系统讲解、仪表盘、发布检查清单,随会话推进自动更新。artifact 基于会话完整上下文(代码库、connectors、对话)构建,无需接线数据源或搭建基础设施;每次发布都是同一链接的新版本,带版本历史与画廊。内部测试中最常见的用途是调试:工程师在站会前发起一次事件调查,Claude Code 跑完日志直接生成时间线、可疑 commit 和错误率图表。

https://claude.com/blog/artifacts-in-claude-code

Podcast

Training Data:Rich Sutton 与 Khurram Javed——为什么 AI 模型会停止学习,以及如何重新开始

The Takeaway: 下一波 AI 突破不会来自继续在人类数据(包括合成数据)上 scaling,而来自让机器从自身经验中持续学习、并自己发现抽象——这正是强化学习之父 Rich Sutton 的新公司 Oak Lab 要解决的问题。

强化学习奠基人、The Bitter Lesson 作者 Rich Sutton 与联创、前学生 Khurram Javed 阐释了 Oak Lab 的路线图。Sutton 开场就抛出反常识论断:“不是我的想法怪,是业界才怪”——学习天然是持续的,“continual learning” 这个说法本身就是冗余。他直言合成数据是"一个大错误":任何模拟都是个小世界,而现实世界无限复杂(Big World Hypothesis);合成数据仍由人类专家决定好坏,瓶颈始终是人。LLM 是 Bitter Lesson 的正反两面:靠算力 scaling 大获成功,如今却被有限的人类数据卡住,且部署后"权重从不改变",不再学习。领域最缺的能力是"学会模型、再用它规划",目前尚无实例。Oak Lab 的解法是 continual backprop:每个权重独立步长,不断注入随机初始化单元,治愈灾难性遗忘;终极野心是 20 瓦的万亿参数自训练心智,按摩尔定律 5-10 年可达;大 labs 困在局部最优,因为新范式"先变差再变好",产品锁定让它们无法下注。至于人类会否变得无关紧要,Sutton 说不会——“但 LLM 们可能危险了”;“智能的全部并不只是流利地使用语言……那大约只占智能的 20% 或四分之一。还有更多。我们还没做完。”

https://www.youtube.com/watch?v=xH7U7w9Qzlo