长周期AIAgent必备三要素:休眠、检查点与独立评估
在关注Kimi K3、GLM‑5.2还是DeepSeek V4等基座模型的同时,一个更值得关注的议题正在浮现。近日,Google Cloud AI总监分享了他对“Loop Engineering”的看法,并录制了演示视频,专门解释长期运行Agent的运作机制——它们需要能够跨会话保持状态,在几小时、几天甚至几周的时间跨度内持续工作。此时,基本的工作单元不再只是一个提示词,而是一个完整的多步骤流程,由Agent自己从头到尾地拥有并管理整个流程。
要实现这种长期运行的能力,必须同时满足三个条件。
第一,代理必须真正能够“休眠”。这就像人类真正能够睡觉一样。过去常用的一些方法,比如主动轮询,在这里并不需要,也不可取。你不希望有一个阻塞线程在那里消耗计算资源。代理还必须能够保持休眠状态,直到某种外部事件将它唤醒。唤醒源可以是webhook、定时任务、人工审批或某种人机交互,也可以是工具回调。
第二,每一步都必须设置检查点。我们常谈到无状态,但在长期运行场景下,状态必须在每次转换时持久化保存。即使运行这些流程的容器崩溃了,服务器仍然可以重新部署,而人类哪怕花费数天完成某个操作也无妨。例如在员工入职流程或贷款申请处理中,无论一个人实际完成某一步需要多少天,代理都必须能够从它停下的地方准确地继续,不会产生幻觉记忆或从未发生过的中间步骤。
第三,代理不能给自己的成果打分。我们见过很多人用同一个代理来编写代码,又用同一个代理来审查代码,这种方法需要更细致的考量。包括Anthropic在内的多个实验室的研究已经相当明确地表明,当代理评估自己的输出时,它会持续高估质量,几乎对结果质量过度自信。因此,在这种要求下的最佳实践,实际上是采用三Agent架构:一个规划者(planner)、一个生成器(generator),以及一个独立的评估者(evaluator),由它来实际测试你的结果。
那么,一个长期运行代理实际上是什么样子?如果把持久化状态、事件驱动的休眠机制和独立评估这三个理念结合在一起,你就不再只是拥有一个聊天机器人,而是拥有了能够完成多日、多周工作流程的系统。我们生活中有太多场景,在与企业打交道或与其他机构合作时,由于业务本身的性质,完成所有事情需要很长时间。要让所有东西都签署完毕、分析完成、逐一勾销,长期运行代理非常适合帮助我们压缩这些工作流程,让代理在后台为我们工作、为我们提供支持。