AI Applications

长程 Agent 为什么难:从单步能力到持续收敛

Misaya Yang

长程 Agent 的关键不是每一步都正确,而是让错误可观察、失败可恢复、纠正进入持久状态,并让执行轨迹持续向目标收敛。

Agent Systems, Long-Horizon Agents, Harness Engine, Context Engineering, Multi-Agent, Post-training, Evaluation, Observability

长程 Agent 为什么难:从单步能力到持续收敛 过去两年,Agent 的讨论很容易围绕模型能力、工具调用、规划器、Memory 和 Multi Agent 展开。但真正进入长任务以后,决定体验的往往不是某一个组件够不够强,而是一个更基础的问题: Agent 能否在几十步甚至几百步的执行过程中,持续向最初的目标收敛。 这和模型能否解决一道静态问题并不是同一种能力。 真实的 Agent 会误判、会调用错工具、会修改错误的代码,也会在一个错误方向上浪费大量步骤。一个可用的 Agent 系统并不要求这些错误消失,而是要求错误能够被发现、被修复,并且修复之后任务还能沿着正确方向继续推进。 因此,与其把 Agent 理解成一个“会使用工具的模型”,不如把它理解成一个闭环系统: [ text{Agent} text{Model} + text{Harness} + text{Environment} ] 模型负责在不确定性中做判断,环境提供反馈,Harness 则负责维持执行状态、约束和任务连续性。 长程 Agent 的很多工程问题,本质上都发生在这个闭环里。 1. 为什么“每一步 95% 正确”并不能描述 Agent 讨论长任务时经常会出现一个简单计算: 如果 Agent 每一步有 95% 的概率做对,一个任务需要连续完成 20 个关键决策,那么成功率只有: [ 0.95^{20} approx36 % ] 计算没有问题,但它隐含了一个并不符合现实的假设: 任何一步出错都会永久导致整个任务失败。 真实 Agent 通常不是这样工作的。 一次命令参数错误会产生 stderr,代码运行失败会得到 traceback,测试失败会返回失败用例,文件修改后还可以重新读取验证。Agent 每执行一个动作,环境都会返回新的 observation,下一步决策会基于新的状态重新进行。 真正的执行过程更接近: [ text{Action} rightarrow text{Observation} rightarrow text{Diagnosis} rightarrow text{Repair}...