AI Builders Digest · 2026-09-24

📰 今日共收录 13 位 builder 的观点动态,另附 3 篇 Anthropic Engineering 官方博客更新。

X / Twitter

Vercel CEO Guillermo Rauch 给出了他心目中的 agent 架构三段论:所有成功的 agent 都离不开三样东西——大脑(模型 + 承载逻辑的 harness)、手(工具、计算机、浏览器)、文件(记忆、skills、仓库)。最省事的做法是把它们全塞进一台有状态的电脑里,比如一台 Mac Mini,让 Claude 或 fx 跑一整天;但要在云端低成本地跑 agent,就必须把这几个部件拆开:harness 跑在 Fluid compute 上、用 Workflow 做持久化事件日志以扛住重启与崩溃,手可以换成 Browserbase/Kernel 这样的浏览器集群或 Sandbox 云电脑,而缺的一块是存储的解耦。今天 Vercel 发布 Sandbox 的搭档 Drives,让你能随时挂载一块"外接硬盘",比如跑一个每晚做记忆整合的 cron 任务(他称之为"做梦")时,直接读写文件而不必把整个 agent 电脑启动起来。他认为拆解不只大幅优化成本,还"极大"提升安全性与可审计性——不这么做根本无法安全地运行 agent。 https://x.com/rauchg/status/2102820148629614685

他还推出了 ShellPerfBench:他对新开一个 shell session 的启动时间极其神经质,而 Opus 5.5 找到了很多其他模型漏掉的可观优化点。他提醒,每当你打开一个新终端,你可能都在默默忍受延迟,建议让 agent 去优化 .zshrc 之类的配置文件。 https://x.com/rauchg/status/2102947745132924993

Meta AI 高级总监 Madhu Guru(前 Google,曾主导 Gemini、Veo、Nano Banana)公开反驳 Ben Thompson 的观点,认为对方漏掉了关键一点:消费者与"把事情办完"之间并不是只有一种关系。他以在 Google 和 Meta 做消费者与中小企业产品多年的经验说明,逛衣服对某些人是娱乐,但请屋顶工对绝大多数人是折磨。他的反共识判断是:对这类任务,所谓"更好"意味着几乎零努力——搜索、读十条评价、电话来回、跟保险协调、约勘查、比报价、识别隐藏费用、核实过往工程、签约、排期,这一整套摩擦背后,消费者对能消除它的 agent 存在巨大的潜在需求(latent demand)。 https://x.com/realmadhuguru/status/2102777931764498536

Ryo Lu(设计过 Cursor、Notion、Stripe)写下了一篇反效率宣言。他的核心警告是:AI 的危险不是让人变懒,而是让人无限忙碌——在找到真正的意图之前先给了我们无限的产出,在培养出品味之前先给了我们无限的执行,在学会静止之前先给了我们无限的动作。他质疑"我们能合并 2000 个 PR、管理 500 个 agent、醒来看到仪表盘证明机器在你睡觉时仍在运转"到底意义何在,直言速度不是意义、规模不是智慧,如果自动化只是让所有人跑得更快,那它就不是自由。他认为真正的前沿不是更快的速度,而是 discernment:知道什么不该做、知道何时停下,并期待 AI 成为新的画布,让人做出更人性、更有想象力的东西。 https://x.com/ryolu_/status/2102933485795369213

Anthropic 的 Boris Cherny(Claude Code) 为形式化方法爱好者补充了技术细节:Claude 的做法是先在程序里建模,瞄准棘手的状态机或容易出竞态的部分,再在模型里寻找反例(这些就是疑似 bug),然后复现这些 bug,最后回到代码里修掉它们。他强调这并非整个代码库都已形式化验证(目前还不是,虽然他在"yet"后面加了感叹号),而是最毛糙的部分被建模、检查反例并修复。他还提到最近几周 claude.ai 和桌面端明显变快,团队把优化经验写进了博客,对想加速自己应用的工程师很有参考价值。 https://x.com/bcherny/status/2102898067133595992 https://x.com/bcherny/status/2102854267782705648

OpenAI 的 Thibault Sottiaux(Codex & ChatGPT) 预告下周二 DevDay:会有一些好玩的东西,但更多的是"应该改变你工作方式"的东西,他说这是团队最有野心的一次冲刺,而 Astra 让很多新东西在极短时间内变得可能。他另一条帖子讲自己已经习惯直接打电话给 ChatGPT 聊工作、查邮件、写代码、管日历,并且这套语音能力横跨整个插件生态,包括第三方开发的插件。 https://x.com/thsottiaux/status/2102996313780736363 https://x.com/thsottiaux/status/2102814202117411196

Claude 官方账号(Anthropic) 宣布 Claude Marketplace 上线:你可以在这里发现工具、agent 和专家合作伙伴——添加 Slack、Notion 等连接器与插件,从 Cursor、CrowdStrike 等公司购买 agent 和产品,也可以通过 Accenture、Deloitte 这类服务伙伴来扩展规模;如果你是开发者,也可以把自己的工具、agent 或服务列上去。 https://x.com/claudeai/status/2102840851538080172 https://x.com/claudeai/status/2102840855258452037

Swyx(smol.ai / AI Engineer / Latent Space)给出一个很具体的模型评测结论:他把 Latent Space 的 AINews 分别在 5.5 Opus 和 GPT-6 Sol 上跑了一遍,差异是"天壤之别"。他称 5.5 Opus 的报道更精炼、更有品味,slop 味比 5 Opus 还要少,因此决定把 5.5 Opus 作为 AINews 往后的默认模型。 https://x.com/swyx/status/2102650014552182920

Aaron Levie(Box CEO) 转述了一段关于创意产业未来的预测并表达认同:当门槛和成本降下来,电影会变多而不是变少,片厂会更敢冒险,会有更多人在桌上,很快还会出现全新的叙事形态。他回顾 1980 年代动画曾被当成小众分支、如今却成了最受喜爱也最赚钱的叙事形式之一,斯皮尔伯格、卡梅隆、彼得·杰克逊把新视觉工具当乐器而非捷径。他的结论是:技术一次次重塑创意产业,通常都带来机会的扩张;即便技法与媒介改变,对创意技能和品味的需求也不会消失,只是更多人能有效利用它们。 https://x.com/levie/status/2102934874470617303

Garry Tan(Y Combinator 总裁兼 CEO) 指出创业公司获客正在发生两个同时进行的趋势:让软件 agent 想要你的产品,以及用 agent 让人想要你的产品。他同时评价 Muse 非常令人印象深刻。 https://x.com/garrytan/status/2102955139875397806 https://x.com/garrytan/status/2102974165800399274

Aditya Agarwal(SPC 普通合伙人、Bevel Health 联合创始人,前 Dropbox CTO) 提出一个被普遍忽视的团队指标。他说一个人职业生涯频繁跳槽能说明很多,公司低流失率同样能说明很多:一支共事 3 年以上的团队,吞吐量和韧性都显著高于刚刚组建的团队。他认为投资人和员工最常犯的错误,是只问团队规模而不问团队"共事时长",对团队而言正确的指标是 AUC(曲线下面积,即累积合作时间)而不是人数。 https://x.com/adityaag/status/2102782451643040074

Thariq(Anthropic,Claude Code) 介绍了一种新的博客形态:分享团队如何用具体的 prompt 和技巧完成工作,并且这些做法你应该能复现。他半开玩笑地总结外界观感——“Claude one-shot 了这个”,而实际 prompt 是 1 万字符,里面装着好观点、skills、示例和 API key。 https://x.com/trq212/status/2102857025206255902 https://x.com/trq212/status/2102870353781641416

Dan Shipper(Every CEO) 做了一次有趣的实验:Every 的 agent 包办了九月线下聚会的全部策划,从餐饮酒水单到嘉宾名单,明天下午 6 点在布鲁克林的 brownstone 揭晓成绩——“看一个 AI agent 能不能办一场好派对”。 https://x.com/danshipper/status/2102826854357016793

Peter Steinberger(OpenClaw / OpenAI) 发出一条简短的架构感慨:“有浏览器了,谁还需要 VNC。” 他还给了 Astra 一个好评,认为它正在大杀四方。 https://x.com/steipete/status/2102990776439636089 https://x.com/steipete/status/2103001790069526564

官方博客

Anthropic Engineering: How we contain Claude across products

一年前,Anthropic 会毫不犹豫地拒绝让 Claude 拥有足以打掉内部服务的权限;今天这种级别的访问已是日常,开发者也因此更高效。文章把风险拆成两部分:故障发生的概率,以及单次故障能造成多大破坏。前者随着安全防护和模型训练的进步持续下降,后者(理论爆炸半径)却随能力与权限扩张只增不减。当 agent 能承担过去需要一个人甚至一个团队的工作,不部署的代价大到让风险收益天平强烈倾向采用——前提是产品能被做安全。于是工程问题变成如何限制爆炸半径。文中提到 Claude Mythos Preview 就是一个因爆炸半径过高而在 2026 年 4 月被判定不宜发布的例子,但随着防御方加固关键系统、防护机制成熟,具备相近能力水平的模型有望获得更广泛的发布,尽管仍有残余风险。 https://www.anthropic.com/engineering/how-we-contain-claude

Anthropic Engineering: An update on recent Claude Code quality reports

针对过去一个月部分用户反映 Claude 回答质量下降的问题,Anthropic 追查到三个独立改动,分别影响 Claude Code、Claude Agent SDK 和 Claude Cowork,API 未受影响,三个问题已于 4 月 20 日(v2.1.116)全部修复。问题一:3 月 4 日把 Claude Code 的默认推理强度从 high 调到 medium 以缓解部分用户在 high 模式下漫长到像界面卡死的延迟,这是个错误的取舍,4 月 7 日已回滚,影响 Sonnet 4.6 和 Opus 4.6。问题二:3 月 26 日上线的一项改动会清除空闲超过一小时的会话中 Claude 之前的思考内容,以降低开销。文章强调公司从不有意降低模型能力,并说明了后续如何避免类似问题。 https://www.anthropic.com/engineering/april-23-postmortem

Anthropic Engineering: Scaling Managed Agents: Decoupling the brain from the hands

harness 里通常编码着"Claude 自己做不到什么"的假设,但这些假设会因为模型变强而随时过期,需要被不断质疑。一个具体例子:早期工作发现 Claude Sonnet 4.5 会在感知到上下文接近上限时提前收尾任务,这种"上下文焦虑"通过在 harness 中加入上下文重置来解决;但同一个 harness 用在 Claude Opus 4.5 上时该行为已经消失,那些重置成了死重。为此 Anthropic 造了 Managed Agents:Claude 平台上的托管服务,通过一小组意在超越任何具体实现的接口,替你运行长周期 agent。文章把这件事类比为操作系统当年通过把硬件虚拟化来解决"为尚未想出的程序而设计系统"的老问题。 https://www.anthropic.com/engineering/managed-agents


Generated through the Follow Builders skill: https://github.com/zarazhangrui/follow-builders