Really Big Test-Time Compute in AI Changes Benchmarks, Safety and Research with OpenAI Research Scientist Noam Brown
这期 No Priors 采访 Noam Brown,核心讨论 test-time compute 如何把模型能力和投入预算绑定在一起,也聊到现有评估与安全政策跟不上这种变化。节目还涉及递归自我改进,以及前沿模型竞争会往哪里走。
今天的 X 动态集中在 Claude Code、agent 工作流和 AI 代理管理,也有人讨论 test-time compute、评估体系与 AI 时代的杠杆问题。播客部分围绕 OpenAI 研究员 Noam Brown,重点聊了测试时算力、评估失灵、递归自我改进和前沿竞争。共收录 14 位建造者、1 个播客条目。
这期 No Priors 采访 Noam Brown,核心讨论 test-time compute 如何把模型能力和投入预算绑定在一起,也聊到现有评估与安全政策跟不上这种变化。节目还涉及递归自我改进,以及前沿模型竞争会往哪里走。
实用 AI 教程与访谈
围绕比赛、赛场氛围和即将发布的播客内容发言,也提到自己在冲刺 YouTube 订阅目标。
Linear 产品负责人
批评把“开很多 Claude Code 标签页”当成实力展示,认为用实时策略游戏去管理 agent 的思路是死胡同。
Anthropic AI 的哲学与伦理讨论
讨论从医生那里拿到概率判断有多难,指出即使要求区间概率,最后也往往只是直觉式猜测。
Anthropic Claude Code / cowork
征集 Claude Code 的工作流、产物和使用场景,并给出了一个用它做候选人搜寻的动态工作流示例。
Anthropic Claude Code
用带点自嘲的方式把“神启”和 AI 末日想象放在一起,吐槽自己身在 San Francisco。
Replit CEO
发图庆祝美国 250 周年。
Vercel CEO
押注 USA 对 ARG 的决赛组合,提前放话自己“早就说过”。
Y Combinator 总裁兼 CEO
强调“无约束时代”已经到来,认为财富来自好点子和执行杠杆,并借大阪观察谈日本在低增长下如何靠服务和工艺取胜。
FirstMark VC,MAD Podcast 主持人
用“让 AI agent 不要出错”来调侃,也夹带了几条体育梗和对挪威球队、球迷的评论。
Builder
重新分享自己做的“理解代码”技能,顺着当前语境强调读懂代码的重要性。
fpvventures 合伙人
吐槽创始人和 VC 只聊 30 分钟太表面,称赞 Claude Code,并征集巴黎、因特拉肯和苏黎世的亲子素食旅行建议。
多代理/工程工具实践者
强烈推荐一个工具/服务,并附上原始链接。
every CEO
继续围绕 ultracode 与 Fable 的“make no mistakes”梗发散,还用“100 个 agent 改按钮颜色”做夸张演示。
OpenAI CEO
分享孩子第一次把两个词连起来说,感叹这件事的惊喜程度和 GPT-5.6 发现新数学不相上下。