数字员工的自我进化:从 Harness 开始,每天重复干同一件事

Harness RSI Runs on Production Data, Not Algorithms

最近读了一篇关于 Harness 自进化的报道,里面有个细节让我停下来想了很久。

停下来的原因,是我们自己也卡在这里:数字员工上线一段时间了,它好像变「顺手」了,但说不清是不是变「聪明」了。这个模糊感,恰好被报道里的三个数字点破。

报道里那家公司说(厂商自报口径):他们平台上 95% 以上的 Agent 被每天重复运行;在留存用户中,93.4% 的操作是系统自触发的;超过六成的自动化流程持续运行了一个月以上。

大多数人读到这三个数字,看到的是「这家公司用户很多」。我看到的是另一件事:这三个数字加起来,恰好是递归式自我改进(RSI)最稀缺的原料。

Harness RSI Runs on Production Data, Not Algorithms

一、先说清楚:什么是 Harness RSI

RSI(Recursive Self-Improvement)的目标是让 AI 改进 AI 自己。它有三个层面:

层面改进对象难度
Artifacts产出物(代码、文档、答案)的自我评估与优化
HarnessAgent 执行任务用的 Prompt、Memory、Tool、Skill、任务剧本
模型权重本身,或训练下一代模型

业界的一个关键判断是:RSI 会先从 Harness 层爆发。 一位知名研究员在博客《Harness Engineering for Self-Improvement》里明确提出了这个判断——理由很实在:Harness 是 Agent 已经能读懂、能改写的代码,改完可以立刻用实验验证;而改权重需要训练设施和可靠的奖励信号,这两样现在都还不成熟。

这个判断我在 AutoHarness 那篇 里已经用 Warp 的公开实现验证过一轮:改的是 Skill 配置,不是权重;走的是 PR 评审,不是黑盒训练。

但这里有一个很容易被混淆的概念,必须先拆开:「个性化记忆」不等于「自我改进」。 记住用户的偏好、历史、上下文,Agent 会越用越顺手——但它的能力上限没有变。真正的自我改进,是从大量真实任务的执行和反馈中,迭代 Harness 或模型权重,把能力上限往上抬。前者是习惯,后者才是进化。

二、空房间类比:Harness 是房间,不是脑子

那篇报道里有个类比,值得单独拿出来:

把博士生扔进一个只有纸笔的空房间,智商再高也产不出高质量结果;把初中生扔进有网络、有工具的房间,产出可能更多。

Harness 就是这个房间,以及房间里的工具。 模型是房间里的人——没有好的房间,纯靠模型智力难以发挥。

这也回答了 Harness 价值的定位问题:它解决的不是「模型聪不聪明」,而是「模型能不能把活干成」——连接数据库、读文档、解析结果、失败重试。这些是可行性问题,不是智力问题。

顺着这个定位,就得到了一个工程判断:Harness 自迭代的 ROI 高于基模微调。 解决运营层面的问题,远比解决模型智商层面的问题快。改一条任务剧本是分钟级的事,微调一次是周级的事。

三、真正的瓶颈:数据飞轮

但读完整篇报道,我最大的感受不是「自进化技术很厉害」,而是另一句话:

自进化的核心是真实场景数据的质量:没有高质量数据,单有技术上的自我改进,未必能实现想要的结果。

这就是为什么开头那三个数字让我停下来。Harness RSI 的瓶颈从来不在自我改进的算法,而在有没有足够多、足够高频、足够真实的任务数据喂给它。

报道里的数据机制是这样的:真实用户、行业工作流、专业用户评估,构成反馈数据;每完成一轮真实任务,系统据此优化 Agent 的规划方式、工具调用、记忆、任务剧本、模型路由和故障恢复机制——六个优化对象,全部围绕真实执行轨迹转。

这背后是三个商业命题,也是数据价值的全部去处:

  1. 更好地解决任务——成功率
  2. 更快地解决任务——时延
  3. 更稳定高效地解决问题——可靠性与成本

注意第三个。稳定性是商业落地的分水岭。 早期大模型时代,很多任务已经能自动化,但落不了地——因为跑十次对八次,另外两次的失败没人兜底。只有当 Agent 被每天重复运行、同一个任务跑成百上千次,稳定性才有意义,Harness 的自我修复和自我优化才从「锦上添花」变成「刚需」。

所以那三个数字(95% 每日运行、93.4% 自触发、六成以上持续运行超一个月)的真正含义是:这个平台上的 Agent 已经进入了「工作场景」,而不是「演示场景」。 只有工作场景才天然沉淀持续、可比较的业务执行数据——这是飞轮转起来的前提。

四、客观错误归 Harness,主观错误归后训练

数据飞轮转起来之后,还有一个必须诚实面对的边界:Harness RSI 只能修正客观性错误。

连接数据库失败、文档解析报错、返回空结果——这些有明确对错,Harness 层可以闭环:发现、修复、验证、沉淀。但「这个任务结果做得好不好」是主观判断,Harness 改不动,需要基模的后训练补齐。

所以完整的自进化是两层分工:

          客观性错误                  主观性错误
       (链路断、解析失败)          (结果质量好坏)
              │                          │
              v                          v
      Harness 层闭环               评测 + 模型后训练
     (任务剧本/路由/恢复)          (数据反哺训练)
              │                          │
              └──────────┬───────────────┘
                         v
                    完整自进化
# generated by hugo AI

这一点和我在 Agent-as-a-Judge 里说的「没有自动化评测的眼睛,自进化就是盲的」是同一件事的两面:Harness 层的闭环靠客观信号就够,但越往上走,越需要评测系统来当眼睛。

报道里还有一个配套的判断:当数据积累到一定规模,系统会自行决策——何时调前沿模型、何时用垂直模型、哪些经验留在 Agent 层、哪些值得训进模型参数。内部基准显示自训模型比外部 API 更快更便宜。这条路径的终点不是「用上最好的模型」,而是「用更低的成本交付同样的结果」——很多企业本来就用不起最前沿的模型,高效的垂直模型加 Harness 路由,才是商业上可持续的形态。

五、数字员工:天然的 Harness RSI 土壤

把上面的逻辑落到我们自己的场景,结论几乎是顺理成章的:

数字员工是 Harness RSI 的最佳土壤。

回看飞轮的三个原料条件:

条件数字员工的天然属性
高频同一批任务每天重复执行,7×24 不停
真实跑在真实业务流里,失败有真实代价
可比较任务同构,执行轨迹可以互相比较

这三条,恰好是数字员工的定义性特征。一个一次性的演示 Agent 产生不了飞轮;一个每天跑同样任务的数字员工,天然就在给飞轮蓄能。

报道里的电商 SEO 案例是最好的说明:大量用户提出相似要求,平台积累了大量相似工作流,从宏观层面积累用户反馈数据,最终实现平台级的 Harness 优化——新用户构建 SEO Agent 不再像第一批用户那样反复调优,直接得到满意结果。个体的经验通过 Harness 层变成了所有人的起点。 这就是飞轮的样子。

而六个可自进化的对象,每一个都能直接映射到数字员工的日常:

  • Prompt——从失败回复中迭代话术
  • Skill——把跑通的流程沉淀成能力
  • 任务剧本——修正规划路径
  • 模型路由——逐轮把便宜模型换上来
  • 故障恢复——我称之为最被低估的一个,见下文
  • 消息解析——把解析失败变成解析规则

故障恢复值得多说一句。数字员工 7×24 运行,最大的风险不是任务做不好,而是那些隐蔽的故障——我在 数字员工生产实践 里写过,「进程活着 + HTTP 200 ≠ 大脑活着」:进程还在、端口还听,但到模型网关的链路断了,容器依然完好。这类故障正是 Harness 自我修复的靶子——它不靠人盯,靠系统自己发现「我最近的任务成功率掉了」,然后触发排查和修复。

六、写在最后:基础设施的使用者不再是人

那篇报道的终局判断,我深以为然:

未来生产力工具的使用者不是人,而是 AI。

如果接受这个判断,那么做数字员工、做 Agent 平台的团队,真正在建的东西就不是「更好用的工具」,而是 企业自进化的基础设施——一个让 Agent 在其上反复运行、管理、迭代的底座。工具的形态会变,但「让 Agent 持续运行并从中学习」这个底座不会变。

所以回到最开头那三个数字。95%、93.4%、六成——它们看起来是运营数据,其实是自进化的燃料读数。

如果你也在做数字员工,不妨先问自己一个问题:你的 Agent,今天重复运行了吗?

没有高频重复,就没有飞轮。而飞轮,是自我改进唯一诚实的入口。

你的数字员工现在靠什么变聪明——换模型,还是攒数据?欢迎留言聊聊。


See also