AI Builders Digest · 2026-08-23

X / Twitter

Thibault Sottiaux(OpenAI,Codex & ChatGPT)

Codex 用量限额(rate limits)更新:团队发现三处效率问题,一是长会话多次 compaction 时图片的使用效率,二是 Computer History 功能的高 p95+ 用量,三是一个本用于生成对话标题的功能消耗超出预期。已组建 tiger team 修复,明天随修复一起,所有付费订阅的用量将完全重置。

https://x.com/thsottiaux/status/2091407991736332689

Peter Yang(AI 教程创作者)

两条实用内容:一是隐私清理技巧,在 Chrome 打开 Google 的第三方应用授权页,让 Codex 或 Claude Code 读取浏览器里打开的标签页,由 AI 挑出该撤销授权的应用并执行,他借此断掉了半数本不该拿到他 Google 信息的应用;二是他正在做一个名为 /fuck-cancer 的 AI skill,帮助患者和家属了解治疗流程、保持信息同步,正在征集应该包含哪些功能。

https://x.com/petergyang/status/2091331251211059468 https://x.com/petergyang/status/2091239339204415969

Madhu Guru(Meta AI 高级总监,前 Google Gemini/Veo/Nano Banana 负责人)

“How to build great evals” 系列第 6 篇:在 eval 上做 hill climbing,就是挑一个真正重要的维度然后优化它,比如基于最新生产数据提升高价值用户旅程的质量、扩展到相邻用例,或降低成本与延迟。失败模式分类法是最好的指南针:比如工具调用频繁失败,往往是因为一次往 context 里塞了 20 个工具,而每个任务其实只需要 3-5 个,用 context engineering 对症下药。他还建议先用最好的模型上线,确认用户喜欢体验后,再 hill climb 到更小、更便宜、更快的模型。

https://x.com/realmadhuguru/status/2091278653435072523

Amjad Masad(Replit CEO)

一句话表明 Replit 的发布节奏:“一周有 7 天,那就是 7 次发布。”

https://x.com/amasad/status/2091346778746757204

Guillermo Rauch(Vercel CEO)

反共识的仓位表态:AI 能做很多事、能满足很多愿望,但我们只有一个地球、一个加州、一个巴塔哥尼亚、一个门多萨。美国和阿根廷是最自由、地理也最壮丽的两个国家,“我非常做多美国与阿根廷,我们还早得很。”

https://x.com/rauchg/status/2091338152791474331

Aaron Levie(Box CEO)

AI 扩散真正卡脖子的是好的 eval,多数人没意识到。每次模型发布配套的公开 eval 很有用,但只能说明通用 AI 进步的大致形状;更大的空间是企业所有主要工作流、细化到具体公司的 eval。“你无法自动化你无法评估进展的东西,企业不能只凭感觉(vibes)做事。”

https://x.com/levie/status/2091359223368315050

Zara Zhang(Builder)

两个观察:一是 AI 让有才华的人做自己的事时潜力放大 10 倍,但同一人放进大组织,潜力最多提升 20%,有时甚至下降,这就是越来越多人才离开大公司的原因,OpenAI/Anthropic 这类顶级 AI 实验室是例外;二是"每个在 AI 使用上领先的人,都觉得自己落后了。"

https://x.com/zarazhangrui/status/2091379220257603593 https://x.com/zarazhangrui/status/2091338374447763481

Nikunj Kothari(fpvventures 合伙人)

给创始人的一句直球:先 ragebait 投资人、再甩一份 SAFE 文档让人打钱,这不是融资该有的玩法。

https://x.com/nikunj/status/2091381756012511244

Podcast

AI & I by Every:Microsoft’s Vision for an Internet Made for Agents With CTO Kevin Scott(Best of the Pod)

The Takeaway:模型的推理能力已经跑到了产品前面(capability overhang),接下来一年最大的机会不是继续堆模型,而是把 agent 生态"接上管道",让 agent 像网页一样可连接、可调用、可授权。

Kevin Scott 是微软 CTO,写了 41 年代码,自称"老顽固",至今坚持用 vi 编辑器,同时也是木工和陶艺爱好者。他提出的核心概念是 capability overhang(能力过剩):模型的推理能力已经超过了产品实际交付给用户的能力,整个行业需要集体补上这个差距,这也解释了为什么今年大家不再谈 scaling laws,它已经是验证过的事实。

agent 要真正有用,就必须能替你采取行动、调用工具、访问各种信息源,而这需要一个像互联网一样的开放生态:MCP 之于 agent 生态,正如 HTTP 之于互联网;NL Web 则扮演 HTML 的角色。作为 CTO,他正在推动微软所有内部系统对自家 agent 说同一种标准协议,避免把组织架构图发布出去(Conway’s law)。

关于"用 agent 写代码会毁掉手艺感"的担忧,他的回应很朴素:“保持好奇,去试。如果它对你有效,就用它;如果没用,就别用。“他后悔当年迟迟不肯学 3D 打印机。他还预测,一年后人们会从"同步式"使用 agent 转向"异步式”:把任务丢出去,agent 自己跑很久、反复迭代,最后回来交差。

https://www.youtube.com/playlist?list=PLuMcoKK9mKgHtW_o9h5sGO2vXrffKHwJL