‹ Back to list

什么是循环?彼得·斯坦伯格 vs 鲍里斯·切尼

4165 words· Original link ↗

摘要:文章探讨了“WTF”在AI编程中的含义,主要指“循环”——一种由程序员编写的程序,自动向AI代理发送提示并管理其工作流程。随着AI技术发展,循环逐渐取代传统提示工程,成为高效编程的关键,但其成本和管理挑战也日益凸显。 主推文 “WTF”到底是什么意思?彼得·斯坦伯格 vs. 伯里斯·切尼 https://t.co/DM0CAuyprS 本周AI编程中最常被重复的一句话是六个字,但几乎没人能解释清楚它的含义。本周有一条推文控制了整个时间线,所以我运行了/last30days,查看了大家争论的这个词。答案是真实的,它有五年的历史,而笑点在于,现在昂贵的部分是循环,而不是模型。 控制整个AI编程时间线的那条推文 本周有一条推文让整个AI编程时间线都为之着迷。彼得·斯坦伯格于6月7日发布了这条推文,浏览量超过220万次,回复区演变成了关于它真正含义的争吵。 “这是你每月的提醒:你不应该再向编程代理发送提示了。你应该设计循环,让这些循环来提示你的代理。” @steipete,2026年6月7日 这句话是大家引用最多的。最引人注目的是瓦拉德·贾恩的回复,他提出了唯一重要的问题:这在实际中是什么样子的?而成为整个氛围的答案是马修·伯曼的。 “没人知道,只有他和伯里斯知道。” @MatthewBerman,2026年6月7日 这才是真实的故事。并不是说循环是未来,而是说一个六个字的短语获得了两百万次浏览,而那些推动它的人在回复中争论它的含义。我没有翻白眼,因为我每天晚上都会运行一个循环,在我睡觉时自动打开大约三十个开源仓库的拉取请求。90秒的研究返回了十五个Reddit帖子、二十一条X推文,以及一个令人不安的模式:AI编程中最响亮的想法,是大多数人重复却无法解释的。一方高喊提示工程已经过时,另一方则更谨慎,他们手上正握着键盘。 “这不是拉尔夫/目标循环,现在这已经老掉牙了。它可能是一种持续协调的循环,负责监督其他线程/代理。” @trashpandaemoji,2026年6月7日 这条回复是迄今为止最接近正确答案的。 循环到底是什么 伯里斯·切尼在2024年9月将Claude Code作为副业创建。据称,它现在几乎位于GitHub上所有公共提交的背后。6月2日,在WorkOS举办的Acquired Unplugged活动中,他在台上给出了最清晰的循环定义。 “现在它实际上又升级到了下一轮抽象,我不会再向Claude发送提示了。我有循环在运行,是这些循环在向Claude发送提示并决定该做什么。我的工作是编写循环。” 伯里斯·切尼,WorkOS Acquired Unplugged,2026年6月2日 那么,这里就是简单的解释。循环是你编写的程序,它代表你向编程代理发送提示,读取它生成的内容,判断是否完成,如果没有完成,就再次提示它。你不再是循环内部输入提示的人,而是成为循环的作者。模型变成了一个子程序。 Boris将整个过程划分为三个阶段,把自己放在他的阶梯上是最快理解的方法。一年前,他还是用手编写代码并使用自动补全功能。然后他同时运行五到十个Claude会话,分别向每个会话发出提示。现在他完全不需要发出提示了。他编写出能够提示Claude的循环,此外还有几百个智能体在阅读他的GitHub、Slack和Twitter,决定接下来要构建什么。他拿到了凭证。 “在过去的30天里,我为Claude Code做出的100%贡献都是由Claude Code编写的。我提交了259个拉取请求。” Boris Cherny,通过Simon Willison,2025年12月27日 他在11月删除了自己的集成开发环境(IDE),从此再也没有打开过。那些认为提示工程已死的人忽略了一个细微差别:他并不是说工程师已经过时了。仍然需要有人决定要构建什么、与客户沟通以及协调团队,他表示,优秀的工程师比以往任何时候都更加重要。这份工作并没有消失,只是提升到了更高的层次,从编写代码变成了编写能生成代码的东西。 谱系:从ReAct到编排 回复内容一团糟,因为“loop”至少隐藏了五种不同的含义。下面这张阶梯图从最老到最新排列,这样你就可以停止和别人说不同话了。 第一阶段是学术型的while循环。2022年的ReAct论文正式定义了它:模型进行推理,调用工具,读取结果,重复直到完成。一个模型,一个循环,一个人在旁边观看。第二阶段是2023年的AutoGPT,它给循环设定了目标并让它自己进行提示,它因为永远做无用功而闻名。这次失败催生了多年“智能体只是玩具”的观念。 第三阶段是Trash Panda称之为过时的:由Geoffrey Huntley于2025年7月发表的ralph循环。它简单得近乎侮辱,只是一个将相同提示文件反复输入智能体的bash命令行。它的真正创新在于纪律性:每次迭代都将上下文重置为一组固定的锚文件,而不是让对话持续增长。Huntley用它构建了一种完整的编程语言,花费约297美元。第四阶段将其产品化:2026年春天,Codex和Claude Code都推出了/goal命令,该命令会运行ralph循环,直到一个小的验证模型确认任务完成。 第五阶段是Boris和Steinberger真正想要表达的,这是真正的新东西,而不仅仅是改了个名字。有四个变化。循环成为工作单位,而不是任务。循环开始监督其他循环,同时按计划进行。调度取代了人工启动,因此循环在基础设施的时间运行,而不是你的注意力。持久性变得显性化,使用基于Git的状态和崩溃恢复,因为这些必须在重启后仍然存活。Ralph假设你的终端一直开着。2026版本则假设它不会。因此,Trash Panda两次都对了:单智能体的ralph循环已经过时了,而在其之上的多智能体编排循环才是新东西。 这不过是个戴着帽子的定时任务 整个语料库中最好的怀疑论观点只有四个字,是有人在大肆称赞loops将引领未来时发表的。 “Cronjobs现在有很有趣的重新命名。” X回复,关于循环的讨论,2026年6月 这需要一个直接的回答,而不是回避,因为它说对了一半。是的,调度层就是cron。Boris本人就是用cron运行他的。Claude Code中的/loop命令内部也使用cron。如果你对循环的定义就是定时运行的东西,那么是的,我们早在1975年就发明了这个,你可以回家了。 但cron从未具备的是中间的部分。cron作业运行的是固定脚本。而循环运行的是一个模型,它会查看当前状态,决定下一步做什么,执行它,检查是否有效,然后决定是否继续。这个决策是智能体的,而不是你的,也不是硬编码的分支。将这些堆叠起来,让一个循环调度并监督其他循环,给它们持久化的共享状态,你就得到了cron无法表达的东西。诚实的表述不是说循环是新的魔法,也不是说循环只是cron。而是说循环是cron加上身体中的决策者,而有趣的工程在于围绕这个决策所做的一切,以防止它失控。 当你真正构建一个时看起来是什么样子 理论够了。入门只需要一行。Claude Code已经发布了/loop,而Boris自己的例子是标准的起点。粘贴这个并更改名词。 /loop 监督我的所有PR。自动修复构建问题,当有评论时,使用worktree代理来修复它们。 这是他更完整的方案。几天后,Boris发布了五个关于让Opus自主运行数小时或数天的技巧。 用他的话说,五个技巧是:使用自动模式处理权限,这样Claude不会要求批准;使用动态工作流让Claude协调数百或数千个代理来完成任务;使用/goal或/loop推动Claude持续运行直到完成;在云端使用Claude Code,这样你可以关闭笔记本电脑;确保Claude有一个端到端自我验证工作的方法。 @bcherny,2026年6月 第五个技巧是炒作中被忽略而从业者却着迷的:循环的可信度取决于它自我检查工作的能力。 这就是整个理念的精简版本。你没有写出步骤,你写的是意图和停止行为,而循环会在每个周期提示代理。在TikTok上,这种表述对普通观众来说很清晰。 “循环模式是AI编程从一次性提示向后台操作转变的最明确标志之一。” @ai.native.founder在TikTok上,2026年6月 深度玩法是Steve Yegge的Gas Town,于1月推出:二十到三十个由市长代理协调的Claude Code实例,有巡逻代理持续运行循环,并将状态存储在git中,以便工作在崩溃后仍能保留。这就是持续协调循环,监督其他线程,而Trash Panda之前所追求的正是这个,现已开源。 但这项研究中最实用的教训是,一个循环的有效性取决于它自我检查的能力。增长最快的子主题不是编排,而是验证。 “你的编码代理可以运行得很快,但错误的提交也会迅速累积。” @DanKornas,2026年6月 Kornas正在发布roborev,这是一个在后台审查每个提交的工具,并在上下文还清晰的时候将结果反馈给代理。一个没有反馈的开环系统,只是制造自信错误的机器。而一个能编写、运行、读取结果并进行修正的闭环系统才是真正有效的。循环本身并不是魔法,而是其中的反馈机制。 转折点:循环现在成了昂贵的部分 这就是研究从哲学转向财务问题的地方。整个代理神话中最尖锐的破灭来自于一位工程师的实操经验。 “今年我发布的每个AI代理都只是一个for循环,一个大语言模型调用,以及一个围绕JSON解析的try/catch语句。它唯一具有代理性质的地方,就是月底的Anthropic账单。” @rohit_jsfreaky,2026年6月 这笔账单可不是玩笑。本月的账单显示:在四个月内花光了年度AI预算后,优步将工程师使用Claude Code和Cursor的费用限制为每人每月1500美元。当模型几乎免费地写出代码后,成本就转移到了循环运行代码上。 “AI编码中最昂贵的不再是编写代码,而是管理代理循环。” @runes_leo,2026年6月 而所有生产环境中的人都害怕的失败模式,就是那个无法停止的循环。 “没有防护措施的话,你会遇到无限循环,以及超出预算数量级的账单意外。” @cv_usk,2026年6月 这就是为什么2026年所有关于循环的严肃讨论最终都集中在三个硬性停止条件上:最大迭代次数、无进展检测以及令牌或美元预算上限。循环的浪漫版本是,你编写循环,然后上千个代理在一夜之间帮你建立公司。而实际生产环境中的版本是,你编写循环,而你大部分的工作是确保它们停止运行。Gartner将代理AI置于过度炒作的顶峰,仅有约17%的组织真正部署了代理。时间线与实际账单之间的差距,才是真实的现状。 这不是循环,而是技能。 这是我一周观察后的个人看法。循环只是基础设施,真正有价值的资产是它所调用的技能。 Steinberger的另一个反复强调的观点与循环有关,而且更为持久:如果你重复做某件事,就把它变成自动化技能;如果你做了某件困难的事,之后把它变成技能,这样下次就免费了。一个内部没有可复用技能的循环,只是在陌生事物上无限循环。而一个调用一系列精准、经过测试、有名称的技能的循环,才是一个能不断积累的系统。真正将这些理念付诸实践的Reddit用户说得最到位。 “很多网友在推特上翻白眼,但我的耳朵却竖了起来。” r/ChatGPTCoding,2026年6月 所以对于“WTF is a loop”(什么是循环)这个问题的答案,并不是关于提示工程消亡的激进观点。答案是:停止成为循环中的那个东西。编写一次循环,赋予它值得调用的技能和反馈机制,让它能自我检查,设置上限使其停止运行,然后让它在cron定时任务中运行,你则去决定下一步要开发什么。Steinberger和Boris从两个不同角度描述了同一种事物。真正了解的人都是已经亲手搭建过的人。好消息是,从本月开始,入门方式只需一个斜杠命令。 研究中的关键模式 循环是cron定时任务加上身体中的决策者:模型(而非硬编码的分支)在每个周期中选择下一步动作。 谱系是真实的:2022年的ReAct,2023年的AutoGPT,2025年的ralph,2026年春季的/goal,现在的协调循环。单智能体的ralph已经过时了,多智能体监督才是新层次。 循环的质量取决于它的反馈机制。持续的审查和验证机制才能让循环变得可靠。 昂贵的资源从token(令牌)转移到了循环管理。要限制迭代次数,检测无进展状态,设定美元预算。 循环内部的可复用单元是技能,而不是提示。调用明确命名技能的循环会不断积累效果;而每次都重新推导所有内容的循环只会浪费资金。 所有智能体的反馈汇总 Reddit:17位用户(r/ClaudeAI,r/AI_Agents,r/ExperiencedDevs),47个帖子,3.4万次点赞 X:21位用户(steipete,bcherny,runes_leo),56条动态,175次转发 YouTube:4位用户(WorkOS,Lenny's Podcast,Y Combinator),访谈文字稿 TikTok:6位用户(ai.native.founder,nikpolale),34个视频 Instagram:4位用户(sequenzy_com,ai.builders),14个短视频 Hacker News:12位用户,54篇故事,1000条评论 GitHub:6个仓库(gastownhall/gastown,NousResearch/hermes),steipete提交了259+个PR 主要声音:steipete,bcherny,runes_leo,rohit_jsfreaky,MatthewBerman 数据来源:2026年6月7日的/last30days运行记录。分析维度:设计提示编码代理的循环、AI循环、编码循环。 共同创立了一家自动驾驶烤箱公司(后被Weber收购),以及后来成为Lyft的公司。正在重新创业,后续会有更多内容。我运行的循环会在我不睡觉的时候提交开源PR,我用/last30days的研究成果在后台编写这些循环。