AI Builders Digest · 2026-09-12

X / Twitter

OpenAI 负责 Codex 与 ChatGPT 的 Thibault Sottiaux:这周 OpenAI 一口气上线了一批由 Astra 驱动的功能——Images 2.5、GPT-Live-1、Agents API、Data Agent,以及面向金融服务行业的 ChatGPT,而 DevDay 还没到,下周还有更多计划。他同时就近期用户反馈的 Astra 质量问题做了说明:已定位并修复若干问题,包括为旧模型写的 skill 触发过于频繁、一个会导致过早停止或回复旧消息的上下文管理实验(已关闭,粗略估计约 4,000 至 5,000 名用户受影响)、以及一些配置不当的引擎造成的长尾质量下降;整体会重新做一次 reset,体验应该会明显好转。他还宣布 Git AI 团队的 Aidan 与 Sasha 加入 OpenAI,他们开发的开源工具帮助开发者理解 coding agent 如何参与代码库,OpenAI 会继续保持其开源并加大投入。

https://x.com/thsottiaux/status/2098639827084480864

https://x.com/thsottiaux/status/2098612714704891959

https://x.com/thsottiaux/status/2098569976143806918

AI 教程创作者 Peter Yang:他公开质疑「software factory」这个概念。除了验证和测试环节,他不认为 AI 现在能在没有人留在环内的情况下自我改进产品、端到端地构建新功能;把任务整夜挂着让 AI 自主开发,只要它做出一个错误假设,整个产物就白烧了 token。他反问:有哪个产品或功能是在没有人定义需求、没有人工检查的情况下由 software factory 端到端造出来的?他还公布了自己的分工:本地定时任务全部放在 Codex,云端任务逐步迁移到 Grok Bot。

https://x.com/petergyang/status/2098565668241334366

https://x.com/petergyang/status/2098614492066435228

Meta AI 高级总监 Madhu Guru(前 Google,曾负责 Gemini、Veo、Nano Banana):他总结了大多数企业 AI 项目失败的三个原因。一是用旧套路做 AI——CEO 指派一位信任的副手带队组建中央 AI 团队,再从各部门抽调熟人,问题出在技能断层:过去 15 年靠增量改进做产品的团队结构、产品范式和上线学习方式,在 AI 时代都不管用,AI 需要的是实验与发明。二是低估 eval 的投入,多数企业既不理解它的重要性,也不知道什么叫作做好。三是从外部「为公司造 AI」——中央 AI 团队把自己定位成平台团队,造出的工具与实际工作流、上下文和一线判断脱节,最后只换来勉强的采用率,而非实质生产力提升。他的建议是:招真正做成过 AI 产品的领导者(既要有技术/产品深度,也要能赢得那些岗位被重写的人的信任)、把 eval 变成一等公民、把你最好的 AI builder 嵌进要改造的业务部门,和财务、销售、客服一起把东西造出来。

https://x.com/realmadhuguru/status/2098448235048378456

Anthropic Claude Code 的 Thariq:Anthropic 推出 plugin evals,解决「新模型发布后不知道自己的 skill 还灵不灵」的痛点,在 plugin 目录里跑 claude plugin eval init 即可。他的另一个观察是:如今只看 pass/fail 分数已经无法解释 eval——他看到的很多 benchmark 失败来自过于严格的隐藏测试,有些情况下模型的答案其实比预期结果更合理。

https://x.com/trq212/status/2098531560643539440

https://x.com/trq212/status/2098490139798655427

Replit CEO Amjad Masad:Replit 收购了一家完全建立在 Replit 之上的业务,他预计这只是众多同类收购的第一笔。此外,Routines 现在支持预算(budgets)控制;他也很高兴看到社区在 Replit 上做 Astra 3D 实验。

https://x.com/amasad/status/2098548464452055437

https://x.com/amasad/status/2098317466682179643

Vercel CEO Guillermo Rauch:Tailscale 的模型路由(model router)底层基础设施由 Vercel AI Gateway 驱动。他的类比是:AI Gateway 就是新的 CDN——你可以「直连源站」,但很脆弱;也可以自己造轮子,但既痛苦又昂贵。

https://x.com/rauchg/status/2098531157230969062

Box CEO Aaron Levie:他介绍了一个很酷的新能力——现在可以把 Box 挂载到 agent sandbox,让 agent 更方便地在自己的「电脑」上读写文件。他的判断是,当 AI agent 在企业里执行关键工作流时,它们将需要人类一直拥有的那些基础原语。

https://x.com/levie/status/2098478938003841123

Ryo Lu(曾设计 Cursor、Notion、Stripe):Cursor 现在支持为「大想法」运行 long-lived agents。

https://x.com/ryolu_/status/2098324260867772806

YC 总裁兼 CEO Garry Tan:他抛出一个观点——SAT 拿到 1600 分之后,应该再解锁一场更难的测试,在 1600 之上给出第二个分数,我们需要更多、更高的「卓越」衡量方式;但现实却是把 SAT 禁掉,让一切变成随机抽签,卓越再也无法被识别。

https://x.com/garrytan/status/2098615692425851205

Builder Zara Zhang:她认为「一人公司」被高估了。AI 确实让一个人能做更多事,但创造新东西是极度孤独的过程,你需要有人一起头脑风暴、一起熬、一起庆祝;如果不能和另一个人一起把自己绑在桅杆上,就极容易失去动力。

https://x.com/zarazhangrui/status/2098483800456179923

fpvventures 合伙人 Nikunj Kothari:「成功有无数个父亲,失败却是孤儿。」他说自己直到看见极其成功的 VC 们为热门交易争夺署名权,才真正体会到这句话的分量。大额退出极其罕见,而它们恰恰是募集下一期基金所依赖的东西,所以未来两年会看到很多名字被抹去或「恰好」略过,人人都想改写历史来认领最终成功的项目。许多新兴 GP(emerging managers)正直接面对这个问题——他们能拿给未来 LP 看的只有自己的 track record,而他们该得的那份认可常常没有拿到。

https://x.com/nikunj/status/2098550718923997430

Peter Steinberger(OpenClaw + OpenAI):他给 trycua 提了一个 patch,让按键在 Linux 下可靠工作,并称赞这个框架整体很不错;他还展示了一个在云会话里用 CUA 玩 Doom 的 Astra,「还谈不上 AGI,但大概已经打得过苍蝇的脑子」。

https://x.com/steipete/status/2098527982709256637

https://x.com/steipete/status/2098527519213604889

Every CEO Dan Shipper:他认为更高的 benchmark 分数并不能说明模型在你真实工作上的表现。过去三年,Every 一直在对新模型做「vibe check」——基于真实工作亲手测试的长文评测;现在他们更进一步、做得更量化,团队内部搭了一个平台,让每个人都能基于自己日常的真实工作建立个人 benchmark。

https://x.com/danshipper/status/2098481799047647715

SPC 普通合伙人、Bevel Health 联合创始人 Aditya Agarwal:他关注技术监管、如何在加州鼓励真正的创新、怎样形成两党制。SPC 这个秋季会举办一系列与决策者的技术政策对话,9 月 23 日请到 Steve Hilton。

https://x.com/adityaag/status/2098472517845328303

Podcast

No Priors:Coinbase’s Everything Exchange: Agentic Finance, Stablecoins, and Tokenization with CEO Brian Armstrong

The Takeaway:AI agent 需要自己的银行账户,而信用卡每笔 30 美分的固定手续费根本承载不了 agent 经济——Coinbase 观察到的 agent 电商交易里约 76% 金额不到 30 美分。

Brian Armstrong 是 Coinbase 的联合创始人兼 CEO,同时也是抗衰老公司 New Limit 的联合创始人。他的核心判断是,Agentic Finance 会把 crypto 变成 AI 的原生支付层:链上转账不到一秒、成本不足 1 美分,而信用卡每笔最低 30 美分的手续费,让低于 1 美元的交易几乎不成立。目前观察到的 agent 电商交易里约 76% 金额在 30 美分以下,且大多发生在 agent 与 agent 之间——比如风投做研究、招聘方抓取数据,本质上是带付费的 tool call。他直言「We don’t want the AIs to be unbanked」:如果要把 AI「纳入银行体系」,它们就该有自己的金融服务,所以 Coinbase 让 agent 用一条指令就能开一个自托管钱包账户,未来还会提供与个人身份绑定的独立 agent 账户,以及稳定币背书的信用卡做向后兼容。他预言,不久之后 agent 数量会超过人类,agent 经济的规模也会超过人类经济。

Coinbase 内部最有意思的实验是「递归自我改进」:每个服务、每个团队、每个人都有一个「大脑」——用 markdown 记录该服务历史上的所有事故、必须执行的财务控制、跑过的每个 A/B 测试,以及 PR 被接受或拒绝的完整 Git 历史。当 agent 来改这个服务,它会先「摄入」这个大脑;而人类 review 时若修正了 agent 的思路,这段上下文必须回写进大脑,于是不仅修正这一次,也修正未来所有情况。他观察到,一次性通过(one-shot)的 PR 接受率会随之持续上升。如今这位 CEO 自己也能靠 agent 提 PR:他让一个高成本模型把复杂功能拆成三个阶段、每阶段十项并行执行,不到两小时就收到「十项全部完成、待你 review」的通知,形容这种感觉「非常上瘾」。

其他值得记下的数字与观点:Coinbase 目前 88% 的收入来自非比特币交易;已推出 1:1 由托管真实证券背书的 tokenized stocks(目前仅限美国以外),瞄准全球约 40 亿没有券商账户的人;预测市场上线几个月即达到 1 亿美元收入年化、环比增长超过 100%,他认为其价值远超体育,可以为政策效果定价,甚至形成对人生大问题的「观点市场」。他的另一家公司 New Limit 用 AI 决定下一个实验,已能在人源化小鼠模型中成功重编程至少一种人类细胞,正推进到非人灵长类,明年启动首个一期临床,首选适应症是酒精性肝病,长期目标是做出一套恢复细胞年轻功能的组合疗法,去攻击衰老这个「元问题」。他最后留下一句提醒:当批评者很容易,做 builder 更难但更值得——「it’s actually much more fulfilling if you helped build something in the world that benefited a lot of people」。

https://www.youtube.com/watch?v=uLDK4l_-gUE