Agent 为什么在第 30 步翻车

Long-Horizon Agents Fail When They Leave the Light

上周一个做 Agent 集成的工程师来问我:「我的 Agent 前十步表现很好——读文档、列计划、写代码,都很干净。但到第 30 步左右就开始胡来:调错 API,覆盖自己刚改过的文件,甚至重复执行已经做完的操作。我是不是该换个更强的模型?」

我问他:每次都栽在同一个地方吗?他想了想说,不是,但跑得越远越不稳。

我说,那多半不是模型的问题。 它是走出了灯光照亮的地方。

无独有偶,今年 YC Startup School 上,主持人 Diana Hu 向 Jeff Dean 提了几乎一模一样的问题:「Agent 在前 10 步都很棒,到第 50 步就开始晃了。你觉得今天的瓶颈是什么?」Dean 的回答,是我见过对这个现象最准确的解释。

Long-Horizon Agents Fail When They Leave the Light

[Read More]

Agent 跑了两小时,你一无所知:长程任务的人机通信协议

Designing the Communication Layer Between Humans and Long-Running Agents

上周,一个 FDE 给我发了条消息:「我让 Agent 帮我做一份竞品分析,它说『好的,我开始处理』,然后就消失了。两个小时后我实在忍不住,去群里问『你还在跑吗』,它回了句『是的,还在处理中』。又过了半小时,终于出来了——结果质量不错,但这两个半小时里我完全不知道它在干嘛、做到哪了、有没有卡住。」

这个场景太常见了。而且它暴露了一个大多数 Agent 平台都没认真对待的问题: 长程任务的人机交互设计

不是模型能力的问题,不是工具调用的问题——是 通信协议 的问题。Agent 和人之间,缺少一套关于「什么时候说话、说什么、怎么说」的共识。

[Read More]