How to Build Long-Horizon AI Agents — Mitch Troyanovsky, Basis
本期重点讨论长周期 AI agent 的设计与落地:把 agent 当作非确定性系统来构建,不能只靠离线评测判断是否真正可用。
今天共有 15 位建造者动态和 1 个播客更新。内容主要集中在 AI agent 落地、产品能力演进、个人化智能体与开发者工具生态。下面整理了每条动态的中文摘要和原始链接。
本期重点讨论长周期 AI agent 的设计与落地:把 agent 当作非确定性系统来构建,不能只靠离线评测判断是否真正可用。
achieve ambition with intentionality, intensity, integrity & insanity.
讨论 ai-devblog skill 的思路:让工具先追踪“你认为故事是什么”,再忠实复述阅读内容,并延伸到视觉能力。
Codex & ChatGPT @OpenAI
提到 ChatGPT 免费用户已拥有不限量文本聊天,并由 GPT-5.6 Luna 驱动。
Practical AI tutorials and interviews for busy people | Get my best AI skills and guides at https://
围绕消费级 AI 入口与 agent 工作流展开,认为 ChatGPT 与 Google 正在争夺用户入口,关键是把常用应用接进来让 agent 真正做事。
Sr Director, AI at Meta; Prev: Google - Led Gemini, Veo, Nano Banana.
强调把新想法先通过口头表达出来往往更清晰,避免在写文档的过程中把核心想法越补越散。
ceo @replit. civilizationist
回顾协作编程的世界纪录,也提到 Replit 早期就持续押注代码模型训练与开发者 agent 路线。
@vercel CEO
主张 AI 编程工具应当开源且可扩展,插件标准会让 agent 生态更统一、扩展更容易。
ceo @box - your business lives in content. unleash it with AI
分析真实世界里的 agent 采用节奏,强调它更像协作流程而不是聊天机器人,并指出对部分软件类别的悲观判断被过度解读。
President & CEO @ycombinator —Founder @garryslist—Creator of GStack & GBrain—designer/engineer who h
提出 personal AGI 的概念:不是任意可用的聊天机器人,而是长期了解你的个性化智能体。
VC at @FirstMarkCap. Host: MAD Podcast; Organizer: Data Driven NYC, Author: MAD Landscape.
继续围绕 Basis 的长周期 AI agent 访谈展开,并补充了这期内容的多平台收听入口与投资人背景。
Builder. Dangerously skips permissions. Harvard’17. GitHub: https://t.co/KCuEajezlL YouTube: https:/
在团队协作层面发问:是否有人高频使用 Claude Tag 或同类 team agent,以及最有价值的使用场景是什么。
partner @fpvventures - investing in seed/A. previous: early hire @meter, @opendoor, @atlassian & oth
分享融资季的经验贴,提醒创始人别忽视在 VC firm 内部建立连接,并开放公开提问。
ceo @every | the only subscription you need to stay at the edge of AI
晒出自己登上 Axios 的消息,并附上相关链接。
General Partner @SPC, Co-Founder @Bevel_Health | Ex: Early Eng @facebook, CTO @Dropbox, Board @Flipk
继续推送 SPC 申请信息,鼓励大家今天去申请。
AI is cool i guess
表示 GPT-5.6 Sol 在聊天中的表现更好,同时再次强调免费用户可以不限量文本聊天。
Claude is an AI assistant built by @anthropicai to be safe, accurate, and secure. Talk to Claude on
更新 Claude Fable 5 的生物安全护栏,降低误判约 85%,并让模型能覆盖更广泛的日常健康支持场景。