AI Builders Digest · 2026-09-23
X / Twitter
Box CEO Aaron Levie 把这一天称为 AI 的疯狂之日:前沿模型大幅降价,Opus 5.5 刚刚砍价,GPT-6 Sol 和 Luna 又把 token 价格降了 50%。他指出,AI 的单位任务成本以史上任何技术都不曾有过的速度下滑,而每一次成本下降,都意味着你能部署 agent 去啃的场景会戏剧性地扩张。他把这称为 Jevons 悖论在 agent 上的重演,并预测这些改进会直接推动 AI 在经济中的扩散:让 agent 处理全部数据、扫描代码里的安全问题、读遍日志数据来做决策、在工作流里跑 agent 蜂群。token 成本与这些场景能否大规模开启,是直接挂钩的。 https://x.com/levie/status/2102477253070430322
他另一条帖子给出了 Box 内部在 Box Agent 上测试 Opus 5.5 的实测数据:整体达到前沿能力水准,相比 Opus 5 用掉 63% 更少的 token、冗长度降低 42%、速度快 30%,而模型本身还更便宜。几个行业测试的细节很具体:金融服务尽调任务准确率提升 39%,一年期交易记录里找出收购标的定价工具的所有计算错误,Opus 5.5 每次尝试都拿到满分,token 少用 82%;科技行业的云成本分析准确率提升 65%,它选对了留存率计算的口径、全程没有搞混源数据的单位约定,时间减半、token 少 70%;消费品客户账户分析准确率提升 17%,合同里从未写明资深与初级的比例,它从 18 人花名册反推出规则并展示了推导逻辑,还识别出多位客户在单元问卷上拿了满分 10 分,于是改用平均值而不是直接把那个 10 当作答案;临床诊断数据分析准确率提升 15%,它发现两组患者的标准差差了 100 倍以上,重跑之后得出旱季差异并不成立。客户很快就能在 Box AI Studio 里用 Opus 5.5 构建 AI Agents。 https://x.com/levie/status/2102448415775051790
Claude Code(Anthropic)的 Boris Cherny 提出一个值得认真对待的问题:形式化验证会不会成为编程乃至找 bug 的未来?他用 Opus 5.5 对 Claude Agent SDK 做了 Lean 形式化验证,几个简短的 prompt 就换来 16 个修复各种 bug 和竞态条件的 PR。他也说 TLA+ 同样好用,自己有时会把 Lean 和 TLA+ 结合起来,专门查找数据流、并发和状态管理方面的问题。他强调自己两种语言都不算熟,但 Claude 在两件事上都非常强,这种方法对形式化建模代码、发现人类大概率看不出来的 bug 特别有用。 https://x.com/bcherny/status/2102543349102338309
他还给了 Opus 5.5 一个实用主义的对比:这是他最近几周的主力模型。团队让 Opus 5.5 和 Fable 5.1 各自把 HAProxy 从 C 移植到 Rust,两者几乎通过了 HAProxy 的全部测试,但 Opus 5.5 用了 9.5 小时,Fable 5.1 用了 12 小时,且成本低 51%。 https://x.com/bcherny/status/2102439069053747549
OpenAI 的 Thibault Sottiaux(Codex & ChatGPT) 宣布 GPT-6 Sol 和 Luna 正式上线:不仅是全方位的显著提升,在写作和那种"你上手就知道"的整体质感上也有进步。他同时宣布 API 价格永久下调 50%,让这两个模型对大量新场景变得可行,也让订阅用户的额度更耐用。此外,所有 Plus、Pro 和 Business 账户都会被注入一次已存下的 reset。 https://x.com/thsottiaux/status/2102463847714247142
他补充说团队一直在为所有人同时追求效率与智能,并为自己团队的成果感到骄傲:只有在能力顶端拥有足够强的模型,才有可能用它去把其他所有事情都做出巨大改善。 https://x.com/thsottiaux/status/2102440619616682120
Claude Code 与 Cowork(Anthropic)的 Cat Wu 宣布 Opus 5.5 已成为 Claude Code 和 Claude 应用(包括 Cowork)在 Pro、Max、Team 计划下的默认模型。她自己把 Opus 5.5 当主力用,喜欢它清晰的沟通能力和模仿她个人写作风格的能力。产品端统一把 effort 默认设为 medium,智能水平与 Fable 5.1 相当但更快,Opus 5.5 上同样的限额能比 Opus 5 多跑 25%。 https://x.com/_catwu/status/2102437713781944397
Claude Code(Anthropic)的 Thariq 对"能力提升该如何用"给出了一条反直觉的提醒:正确使用模型能力的方式,不是往生产环境塞 10 倍的功能,而是花更多时间理解用户、做实验、搭原型、搞懂自己不明白的东西,这样最终上线的才是真正能用的东西。 https://x.com/trq212/status/2102548686303854790
他还补了一条自我提醒式的产品判断:如果你想做游戏,3D 生成能力很适合帮你把想象中的游戏变成现实,但你应该先想清楚怎么做一个好玩、有满足感的游戏循环。 https://x.com/trq212/status/2102549030303867257
他还提到 workflow 如今在他的 Claude 使用中占比很大,很高兴现在有了在成本上适合与 workflow 搭配的 Fable 级智能。 https://x.com/trq212/status/2102477527688388752
Anthropic 研究团队的 Alex Albert 展示了 Opus 5.5 强化的 3D 建模与视觉能力:他一直在用 Blender 玩 Opus 5.5,现在可以从单个 prompt 构建出一整个世界。他的例子是按 1906 年地震前的样貌重建旧金山 Market Street,历史上准确。他贴出的 prompt 值得一读:限定范围从 Ferry Building 沿 Market 到 Fifth Street,包含 Palace Hotel、Call Building、Chronicle Building、Lotta’s Fountain 和 Emporium;在建模之前,先根据 1899-1905 年的 Sanborn 火灾保险地图、Miles Brothers 1906 年 4 月拍摄的影片、OpenSFHistory 与国会图书馆及 David Rumsey 收藏的历史照片、USGS 地形数据建立一个源文件,为每栋建筑记录占地轮廓、高度、立面材质、使用者和每一项事实的来源与置信度;一切在 Blender Python 中构建,不使用下载的网格、贴图或 HDRI;编写可复用的生成器(维多利亚式商业立面、折线屋顶、凸窗、遮阳篷、彩绘招牌、煤气与电灯、缆车、马车、早期汽车)并按源文件组装街道,让每栋建筑都能追溯到数据;最后输出一段 10 秒钟的沿街视频。 https://x.com/alexalbert__/status/2102466524934271381 https://x.com/alexalbert__/status/2102466523164274839
Vercel CEO Guillermo Rauch 公布了新一轮 Next.js 评测结果:Opus 5.5、GPT 6 Sol、Fable 5.1 都以 97% 并列榜首,Grok 4.7 以 94% 紧随其后,但值得注意的是 Grok 便宜了 2 到 7 倍。 https://x.com/rauchg/status/2102519097770885231
他另一条帖子是一个相当激进的产品判断:“软件永远不会再消亡了。“他举例说,你喜欢 Google Reader 的话,那就自己生成一个并且部署起来,永久属于你。 https://x.com/rauchg/status/2102594015669756323
他还特意称赞了 Anthropic 发布产品的品味,并解释了为什么他对 Web 的"headless"方向感到兴奋:任何一个页面都可以呈现你想要的任何奇思妙想或独特形态,有了 AI 就再没有理由不去推进设计前沿。 https://x.com/rauchg/status/2102438365455167883
Y Combinator 总裁兼 CEO Garry Tan 称 Capy 让他能比单独使用 Codex 或 Claude Code 快得多地提交 PR。他同时提出一个更大的命题:我们需要教会全世界怎么 prompt、怎么最大化地使用 AI,让所有人都看到它能如何为自己的各种追求插上翅膀,然后我们才会渴望为自己和彼此解决更多问题。 https://x.com/garrytan/status/2102544711647129902 https://x.com/garrytan/status/2102501556348440983
fpv ventures 合伙人 Nikunj Kothari 对当下的融资叙事泼了一盆冷水:即便"最优秀"的投资人组织的 SPV 数量也已经多到令人瞠目结舌,以至于你看到一笔大额融资的新闻标题时,可以相当有把握地认为其中很大一部分其实来自 SPV,尽管标题说的并不是这个。再叠加分档估值、以及收入本身并不等同的事实,他的结论是:别再相信新闻标题了,布丁好不好吃要看布丁,而这个布丁在任何公开可见的地方都找不到。 https://x.com/nikunj/status/2102534909076349291
彼得·斯坦伯格(Peter Steinberger,OpenClaw 与 OpenAI) 分享了一个颇有说服力的 agent 找 bug 案例:他升级到 macOS 27 后 ChatGPT 有时会崩溃,而 Astra 顺着这个问题找出了 libuv 里一个约 14 年前的老 bug。 https://x.com/steipete/status/2102501642176528743
Every CEO Dan Shipper 一天涨了近 1 万粉丝,为新读者给了两个入口:一是他在 Every 上对 Opus 5.5 与 Sol-6 的口味评测,二是他在"自动化之后"这个话题上的观点,即 AI 自动化反而会给人类专家创造更多值得做的好工作。 https://x.com/danshipper/status/2102556723244564715
SPC 普通合伙人、Bevel Health 联合创始人 Aditya Agarwal 提出了一个很有意思的历史视角:今天关于"模型"安全与对齐的争论最热,但 AI 与机器学习最早的"安全"辩论其实发生在自动驾驶领域。他第一次坐 Waymo 的感受像是宗教体验,难以想象我们真能造出在真实道路上、面对全部复杂状况都能工作的技术。他认为那场分享里最有意思的部分,是 Waymo 为建立"敢把两吨重的机器以 30 英里时速放上城市街道"的信心而搭建的大规模评测与测试基础设施。 https://x.com/adityaag/status/2102457464432284019
他还提醒,在疯狂追逐生产力的路上,我们常常忘了 AI 产品也应该是令人愉悦、好玩的。 https://x.com/adityaag/status/2102421668509733058
OpenAI 的 Sam Altman 分享了一条关于组织能力的判断:创业公司天然擅长这件事,但让一家更大的公司保持擅长却很难,他认为这是一个被低估的探索空间。 https://x.com/sama/status/2102469008079679640
他还专门为一位同事背书,说她比任何人都更能体现这种特质,OpenAI 非常幸运已经受益于她迄今为止所做的一切,并认为人们会很高兴看到她与团队接下来在酝酿的东西。 https://x.com/sama/status/2102468713866055872
Google 副总裁(Google Labs / Gemini App / Google AI Studio)Josh Woodward 用一句"重大里程碑"预告了进展。 https://x.com/joshwoodward/status/2102498448364954083
Peter Yang 谈到自己为什么对 Opus 5.5 如此兴奋,称这是他一段时间以来对 Claude 模型最期待的一次。 https://x.com/petergyang/status/2102577425838485916
Replit CEO Amjad Masad 给出一条简短的玩梗式宣言:你的智能是假的,是 artificial 的;我的是 super 的,是 Super Intelligence。 https://x.com/amasad/status/2102489320766800002
Claude(Anthropic)官方账号 宣布 Claude Opus 5.5 当日可用,并展示了几件用它做出来的作品:一个是 Kevin Ngo 创作的算法绘图程序,每一幅画基于不同的随机种子;另一个是玩具积木搭建应用,能把一张照片或一段描述转成可搭建的模型,并支持自定义拼搭指令。 https://x.com/claudeai/status/2102471892099866883 https://x.com/claudeai/status/2102471889092276516 https://x.com/claudeai/status/2102471885061812714
Generated through the Follow Builders skill: https://github.com/zarazhangrui/follow-builders