麦肯锡终于说了:Agent 也要绩效考核——但他们没说怎么考

McKinsey Says Agents Need Performance Management — But Not How to Measure Them

8 月底,麦肯锡的播客 McKinsey Talks Talent 里,主持人 Lucia Rahilly 抛出了一个很多公司都在回避的问题:Agent 进了核心工作流,谁来管它?

资深合伙人 Brooke Weddle 的回答很直接:「HR 管理的不再只是人类的绩效,现在还有数字员工。」 全球技术与 AI 负责人 Kate Smaje 接着把问题拆成了三问:

「我到底有多少个 Agent?谁对它们的绩效负责或担责?它们创造了多少价值?」

问完,她自己补了一句更狠的话:当她问企业「上次讨论非人类劳动力的绩效是什么时候」——「几乎没有组织能回忆起自己把这件事排上过议程。」

听到这三个问题的时候,我愣了一下——这不是新闻,这是我今年 3 月起就在博客里反复写的那一系列问题。麦肯锡用了整个 8 月,终于追上了这条线。

他们给出的答案也对:Agent 归使用它的业务负责人管,不是 IT,不是 CTO。 这和我在数字员工的第一准则不是可控性里推导的主管制,几乎是同一个结论的两条路径——他们从管理实践归纳,我从问责公理演绎,殊途同归。

但这份答案只答了一半。

McKinsey Says Agents Need Performance Management — But Not How to Measure Them

一、归属是组织问题,绩效是测量问题

麦肯锡把「谁管 Agent」当成一个组织设计问题:财务 Agent 归财务负责人,销售 Agent 归销售负责人,IT 提供护栏和平台。归属一划清,问题似乎就解决了。

这里藏着一个被跳过的前提:负责人看得懂这个 Agent 的绩效吗?

人好说。老销售这个季度签了多少单、丢了多少单,一眼就能看。但一个财务对账 Agent 的「绩效」是什么?是准确率、是漂移趋势、是调用成本、是权限有没有越界——这些东西没有一个天然长在业务负责人的视野里,它们全部是 测量产物

没有测量基建,「业务负责人负责」会塌成什么样?塌成这样:负责人每周收到 IT 递上来的一张仪表盘,上面写着「本周处理 3,200 笔,成功率 99.2%」。他点了头。三个月后 Agent 出了事故,复盘会上他说:「仪表盘一直显示正常。」

这个场景你应该觉得眼熟。今年 3 月我写过那个亏 80 万的定价 Agent 案例:运营说「是 AI 自动调的」,技术说「数据源有异常」,没有一个人为结果负责(案例详见企业级 AI 必须设计成出错后可以追责到人)。挂名的归属和缺失的归属,在事故面前长得一模一样。

所以麦肯锡的三问,第一问就答不了。「我到底有多少个 Agent」——没有登记台账,业务负责人连自己名下有几个都说不清;「创造了多少价值」——没有评测基线,价值只是一句感觉。归属可以让组织图上多画一格,但 没有尺子的归属,是挂名归属

二、谁来造尺子:财务报表的类比

最强的反方会这么说:造尺子本来就是 IT 的活。业务负责人不需要懂 eval,看报告做决策就行——CEO 也不亲自做账,公司治理两百年来就是这么分工的。

这个类比恰好是最有力的反驳。

财务报表为什么可信?不是因为 CEO 会读它,而是因为会计科目、审计制度、内控流程构成了一套体系——而这套体系的关键在于,「什么算收入、什么算成本」的判断权并不交给记账的人:折旧怎么摊、收入何时确认、成本怎么归集,这些会计政策由业务管理层拍板、董事会批准,会计师负责执行和审计。CEO 不做账,但利润的定义他必须认账。

Agent 的绩效完全是同一个结构:

人类员工体系数字员工体系
考什么岗位职责(JD)Agent Spec 的 mission
考卷谁出业务主管定考核标准业务负责人定义 eval 集
谁监考HR / 系统出分IT / 平台跑评测
多少分算过绩效线准入线
不胜任怎么办培训、调岗、退出重训、降权、退役

注意这张表的关键一行:考卷谁出。 如果 eval 集也由 IT 编写,那业务负责人看到的「绩效」,仍然是 IT 定义出来的绩效——他只是从挂名换了一个更体面的说法。

我们在做会议纪要数字员工的时候,这一点体会得很具体:标准纪要的标定——哪些话算决策点、哪个待办该归谁、跟进项写到什么粒度算合格——工程师根本定不了,只有懂那场会议业务含义的人标得出来。考卷必须由业务出,这不是分工偏好,是测量本身的要求。

三、怎么考:一个真实的上岗考试

尺子的样子,我可以直接给你看——我们用会议纪要数字员工考过一遍,细节在五个问题,判断一个岗位能不能交给数字员工里写过,这里把考试流程完整摊开:

第一步,出考卷。 取 50 场历史真实会议,由懂业务的人逐场标定标准答案:这场会的决策点是什么、责任人是谁、跟进项有哪些。考卷不是编出来的模拟题,是组织真实发生过的历史。

第二步,重放。 让数字员工把这 50 场会逐场重新「开」一遍——输入当时的转写,输出它生成的纪要和待办。

第三步,对照计分。 和标准答案逐项比对。我们的准入基准是:迭代几轮之后,完成率稳定在约 95%(这是我们内部的实践基准,不是行业标准——你的组织可以定自己的线,但必须有一条线)。

考试里有两个发现,比分数本身更重要:

待办是最严的评分项。 摘要写歪了,人看一眼能纠回来;待办是行动承诺——责任人、截止日期、交付物,错一项就是一次错误的组织行动。所以待办三项全对才算对,它决定了整张考卷的下限。

错题是补上下文的路标。 达不到线的时候去看错在哪,十有八九不是模型笨,是上下文缺一角——纪要把「小王」归错了人,多半是发言人识别没接上;待办派错了部门,多半是没接通讯录。考试的副产品,是一份精确的补课清单。

这套考试在数字员工背后的 Agent,是五层基础设施的叠加里被叫做「验收层」,在 Agent Spec 是数字员工的劳动合同里,evals 那个字段就是劳动合同三份契约里的 绩效契约。现在可以补上它在治理侧的读法:这份考卷,就是业务负责人「负责」二字的实体。 拿得出考卷,负责才不是一句空话。

四、上岗考试只是起点:abandonware 与持续考核

麦肯锡在播客里提了一个很值得收藏的词:abandonware——那些被遗忘在网络里、已经不该继续存在的东西。

Kate Smaje 的原话是:「一个六个月前还非常称职的 Agent,今天可能已经是一个重大隐患。」因为模型在变、流程在变、数据在变、业务要求在变。人类员工有年度考核兜着,Agent 连这个都没有——大多数组织的 Agent 从上线那天起,就再也没有被正式考过一次。

这直接推出绩效体系的第二个组件:持续考核。上岗考试决定它能不能入职,定期重考决定它还能不能留任。同一个 50 场的考卷,每季度重放一次——分数掉了,说明上下文腐烂了或者业务漂移了,该补课补课,该退役退役。退役不是事故后的应急动作,是考核体系里一个正常的出口,和员工的退休流程一样体面。

还有一个规模问题。我在 #360 里做过一个压力测试:一个主管名下挂 100 个数字员工时,「背书」会退化成橡皮图章——行动量级远超人类的审计容量。放到绩效语境里,结论是:数字员工的绩效考核从第一天起就必须是自动化的——人没有能力手工批改一百个员工每天上千次的行动。人类绩效一年考一次还能靠主观印象,数字员工的绩效必须是持续运行的评测管道,人只负责出考卷、定线、和处置异常。

五、绩效台账:把三问变成三个字段

最后给一个可以直接拿走的东西。麦肯锡的三问,落到组织台账上,就是每个数字员工登记记录旁边的三个字段:

┌────────────────────────────────────────────┐
│ 数字员工:会议纪要专员 de-minutes-001        │
├────────────────────────────────────────────┤
│ owner:      运营总监(业务负责人)            │
│ eval_set:   50 场历史会议标定卷               │
│             ——出题人:运营总监 + 两位业务骨干  │
│ pass_line:  完成率 ≥ 95%,待办三项全对        │
│ last_exam:  2026-08-28  得分 96.3%  ✅       │
│ next_exam:  2026-11-28(季度重考)           │
└────────────────────────────────────────────┘
        缺任何一个字段,owner 即为挂名
# generated by hugo AI

这三个字段——考卷(谁出的)、准入线、最近一次考试日期——就是业务负责人从「挂名」走向「实责」的全部凭证。它不应该只是一张表,应该是一段能跑起来的校验——像 #360 里「主管字段缺失则拒绝上岗」一样,台账校验不通过,就该拒绝承认这个 owner:

from dataclasses import dataclass
from datetime import date


@dataclass
class DigitalEmployeeRecord:
    """数字员工绩效台账:麦肯锡三问的最小可执行版本。"""

    employee_id: str
    role: str
    owner: str                          # 业务负责人
    eval_set: str | None = None         # 考卷:谁出的、多少题
    pass_line: float | None = None      # 准入线
    last_exam: date | None = None       # 最近一次考试日期

    def owner_is_real(self) -> bool:
        """三字段齐全,owner 才是实责;否则是挂名。"""
        return all([self.eval_set, self.pass_line, self.last_exam])


record = DigitalEmployeeRecord(
    employee_id="de-minutes-001",
    role="会议纪要专员",
    owner="运营总监",
    eval_set="50 场历史会议标定卷(运营总监 + 两位业务骨干出题)",
    pass_line=0.95,
    last_exam=date(2026, 8, 28),
)
assert record.owner_is_real(), "缺任何一个字段,owner 即为挂名"
# generated by hugo AI

盘点数字员工的时候,别只在组织图上加一列 owner;让每个 owner 把这三个字段填出来,让这段校验跑一遍。填不出来的,说明这个 Agent 的责任归属还停留在组织图上,没有落到地面上。

结尾

麦肯锡在 8 月提出了正确的问题:Agent 要有 owner、要考核、要淘汰。这是好事——当这些问题进入经营会议,Agent 才开始真正成为组织的一部分。

但问题清单不等于答案。归属解决「出了事找谁」,测量解决「怎么知道要出事了」。麦肯锡把尺子的制造留白了,而尺子恰恰是让「业务负责人负责」这句话成立的那一层——考卷由业务出,监考由平台做,分数写进台账,退役有体面的出口。

一个留给你组织的问题:你们的数字员工名册上,有多少个员工是「考过试」的?

欢迎留言聊聊。


See also