AI Builders Digest · 2026-08-24
X / Twitter
Garry Tan(Y Combinator 总裁兼 CEO) 大胆预测:核心业务系统(systems of record)要么进化成 AI harness(驾驭 AI 的框架),要么被 agent 直接取代。在他看来,传统记录系统如果不能主动接入并约束 agent 的工作流,就可能在 agent 时代失去存在价值。
https://x.com/garrytan/status/2091742825042030681
Thibault Sottiaux(OpenAI,Codex & ChatGPT 团队) 判断 2026 年是公司开始认真对待模型效率与可靠性的元年——当模型成为关键基础设施,这两者就从"锦上添花"变成生死攸关。他还确认 OpenAI 的用量重置已推送到所有账户,并修复了此前用户反馈的用量问题,后续还有更多改进在路上。
https://x.com/thsottiaux/status/2091581575108653374 https://x.com/thsottiaux/status/2091688655828246890
Guillermo Rauch(Vercel CEO) 认为 intelligence 正在快速变便宜:OpenAI Sol 的降价与 Vercel AI Gateway 的折扣叠加,让 Sol 成为增长最快的 frontier model。这印证了智能需求的强弹性——推理成本下降,用量随之暴涨;不用 gateway 的公司会错失模型价格波动的红利,router/gateway 赛道升温是必然。他还阐述了 Vercel 扩展 fx 的哲学:坚持开放协议(MCP、Skills、Plugins)与 Unix 精神——小程序各司其职、组合调用,libfx 让 fx 可以嵌入更复杂的程序,人人都能构建自己的 CLI、后台 agent 甚至软件工厂。
https://x.com/rauchg/status/2091671326897713424 https://x.com/rauchg/status/2091583525661384813
Madhu Guru(Meta AI 高级总监,此前在 Google 主导 Gemini、Veo、Nano Banana) 分享构建 eval 的"金发姑娘原则":eval 应按任务阶段(jobs to be done)来衡量,而非只盯最终答案。以金融分析 agent 为例,别只检查它是否推荐了"正确"的股票,而要把过程拆成客户理解、证据收集、数据分析、给出建议四个阶段,各自单独设 eval——这样当最终结果出错时,你能立刻定位是哪个环节掉链子(比如数据分析只有 70 分),而不是盲猜。粒度原则:细到足以诊断和行动即可,别过度拆解。
https://x.com/realmadhuguru/status/2091684812012875981
Peter Yang(AI 教程与访谈创作者) 分享 Shreya 关于两种 AI eval 的观点:top-down eval 是"在真空中只凭任务描述,你会设计出什么"——Claude 非常擅长帮你做这类 eval;而 bottom-up eval 是从大量样本输出中把你的直觉反馈外化成测试用例——“Claude 非常非常不擅长生成 bottom-up eval,那全靠你自己。”
https://x.com/petergyang/status/2091586298779955512
Peter Steinberger(OpenClaw 创始人) 认为 CLI 虽好,但在团队协作场景,UI 可视化和"你工作的地方"才是更好的体验。他还给 claw 加入了 USB 旋转协议,接上 360 度摄像头后让 agent 能自己转动"环视"周围环境。
https://x.com/steipete/status/2091650136506327253 https://x.com/steipete/status/2091639468935831910
Podcast
本期无播客更新。