8 月底,麦肯锡的播客 McKinsey Talks Talent 里,主持人 Lucia Rahilly 抛出了一个很多公司都在回避的问题:Agent 进了核心工作流,谁来管它?
资深合伙人 Brooke Weddle 的回答很直接:「HR 管理的不再只是人类的绩效,现在还有数字员工。」 全球技术与 AI 负责人 Kate Smaje 接着把问题拆成了三问:
「我到底有多少个 Agent?谁对它们的绩效负责或担责?它们创造了多少价值?」
问完,她自己补了一句更狠的话:当她问企业「上次讨论非人类劳动力的绩效是什么时候」——「几乎没有组织能回忆起自己把这件事排上过议程。」
听到这三个问题的时候,我愣了一下——这不是新闻,这是我今年 3 月起就在博客里反复写的那一系列问题。麦肯锡用了整个 8 月,终于追上了这条线。
他们给出的答案也对:Agent 归使用它的业务负责人管,不是 IT,不是 CTO。 这和我在数字员工的第一准则不是可控性里推导的主管制,几乎是同一个结论的两条路径——他们从管理实践归纳,我从问责公理演绎,殊途同归。
但这份答案只答了一半。
一、归属是组织问题,绩效是测量问题
麦肯锡把「谁管 Agent」当成一个组织设计问题:财务 Agent 归财务负责人,销售 Agent 归销售负责人,IT 提供护栏和平台。归属一划清,问题似乎就解决了。
这里藏着一个被跳过的前提:负责人看得懂这个 Agent 的绩效吗?
人好说。老销售这个季度签了多少单、丢了多少单,一眼就能看。但一个财务对账 Agent 的「绩效」是什么?是准确率、是漂移趋势、是调用成本、是权限有没有越界——这些东西没有一个天然长在业务负责人的视野里,它们全部是 测量产物。
没有测量基建,「业务负责人负责」会塌成什么样?塌成这样:负责人每周收到 IT 递上来的一张仪表盘,上面写着「本周处理 3,200 笔,成功率 99.2%」。他点了头。三个月后 Agent 出了事故,复盘会上他说:「仪表盘一直显示正常。」
这个场景你应该觉得眼熟。今年 3 月我写过那个亏 80 万的定价 Agent 案例:运营说「是 AI 自动调的」,技术说「数据源有异常」,没有一个人为结果负责(案例详见企业级 AI 必须设计成出错后可以追责到人)。挂名的归属和缺失的归属,在事故面前长得一模一样。
所以麦肯锡的三问,第一问就答不了。「我到底有多少个 Agent」——没有登记台账,业务负责人连自己名下有几个都说不清;「创造了多少价值」——没有评测基线,价值只是一句感觉。归属可以让组织图上多画一格,但 没有尺子的归属,是挂名归属。
二、谁来造尺子:财务报表的类比
最强的反方会这么说:造尺子本来就是 IT 的活。业务负责人不需要懂 eval,看报告做决策就行——CEO 也不亲自做账,公司治理两百年来就是这么分工的。
这个类比恰好是最有力的反驳。
财务报表为什么可信?不是因为 CEO 会读它,而是因为会计科目、审计制度、内控流程构成了一套体系——而这套体系的关键在于,「什么算收入、什么算成本」的判断权并不交给记账的人:折旧怎么摊、收入何时确认、成本怎么归集,这些会计政策由业务管理层拍板、董事会批准,会计师负责执行和审计。CEO 不做账,但利润的定义他必须认账。
Agent 的绩效完全是同一个结构:
| 人类员工体系 | 数字员工体系 | |
|---|---|---|
| 考什么 | 岗位职责(JD) | Agent Spec 的 mission |
| 考卷谁出 | 业务主管定考核标准 | 业务负责人定义 eval 集 |
| 谁监考 | HR / 系统出分 | IT / 平台跑评测 |
| 多少分算过 | 绩效线 | 准入线 |
| 不胜任怎么办 | 培训、调岗、退出 | 重训、降权、退役 |
注意这张表的关键一行:考卷谁出。 如果 eval 集也由 IT 编写,那业务负责人看到的「绩效」,仍然是 IT 定义出来的绩效——他只是从挂名换了一个更体面的说法。
我们在做会议纪要数字员工的时候,这一点体会得很具体:标准纪要的标定——哪些话算决策点、哪个待办该归谁、跟进项写到什么粒度算合格——工程师根本定不了,只有懂那场会议业务含义的人标得出来。考卷必须由业务出,这不是分工偏好,是测量本身的要求。
三、怎么考:一个真实的上岗考试
尺子的样子,我可以直接给你看——我们用会议纪要数字员工考过一遍,细节在五个问题,判断一个岗位能不能交给数字员工里写过,这里把考试流程完整摊开:
第一步,出考卷。 取 50 场历史真实会议,由懂业务的人逐场标定标准答案:这场会的决策点是什么、责任人是谁、跟进项有哪些。考卷不是编出来的模拟题,是组织真实发生过的历史。
第二步,重放。 让数字员工把这 50 场会逐场重新「开」一遍——输入当时的转写,输出它生成的纪要和待办。
第三步,对照计分。 和标准答案逐项比对。我们的准入基准是:迭代几轮之后,完成率稳定在约 95%(这是我们内部的实践基准,不是行业标准——你的组织可以定自己的线,但必须有一条线)。
考试里有两个发现,比分数本身更重要:
待办是最严的评分项。 摘要写歪了,人看一眼能纠回来;待办是行动承诺——责任人、截止日期、交付物,错一项就是一次错误的组织行动。所以待办三项全对才算对,它决定了整张考卷的下限。
错题是补上下文的路标。 达不到线的时候去看错在哪,十有八九不是模型笨,是上下文缺一角——纪要把「小王」归错了人,多半是发言人识别没接上;待办派错了部门,多半是没接通讯录。考试的副产品,是一份精确的补课清单。
这套考试在数字员工背后的 Agent,是五层基础设施的叠加里被叫做「验收层」,在 Agent Spec 是数字员工的劳动合同里,evals 那个字段就是劳动合同三份契约里的 绩效契约。现在可以补上它在治理侧的读法:这份考卷,就是业务负责人「负责」二字的实体。 拿得出考卷,负责才不是一句空话。
四、上岗考试只是起点:abandonware 与持续考核
麦肯锡在播客里提了一个很值得收藏的词:abandonware——那些被遗忘在网络里、已经不该继续存在的东西。
Kate Smaje 的原话是:「一个六个月前还非常称职的 Agent,今天可能已经是一个重大隐患。」因为模型在变、流程在变、数据在变、业务要求在变。人类员工有年度考核兜着,Agent 连这个都没有——大多数组织的 Agent 从上线那天起,就再也没有被正式考过一次。
这直接推出绩效体系的第二个组件:持续考核。上岗考试决定它能不能入职,定期重考决定它还能不能留任。同一个 50 场的考卷,每季度重放一次——分数掉了,说明上下文腐烂了或者业务漂移了,该补课补课,该退役退役。退役不是事故后的应急动作,是考核体系里一个正常的出口,和员工的退休流程一样体面。
还有一个规模问题。我在 #360 里做过一个压力测试:一个主管名下挂 100 个数字员工时,「背书」会退化成橡皮图章——行动量级远超人类的审计容量。放到绩效语境里,结论是:数字员工的绩效考核从第一天起就必须是自动化的——人没有能力手工批改一百个员工每天上千次的行动。人类绩效一年考一次还能靠主观印象,数字员工的绩效必须是持续运行的评测管道,人只负责出考卷、定线、和处置异常。
五、绩效台账:把三问变成三个字段
最后给一个可以直接拿走的东西。麦肯锡的三问,落到组织台账上,就是每个数字员工登记记录旁边的三个字段:
┌────────────────────────────────────────────┐
│ 数字员工:会议纪要专员 de-minutes-001 │
├────────────────────────────────────────────┤
│ owner: 运营总监(业务负责人) │
│ eval_set: 50 场历史会议标定卷 │
│ ——出题人:运营总监 + 两位业务骨干 │
│ pass_line: 完成率 ≥ 95%,待办三项全对 │
│ last_exam: 2026-08-28 得分 96.3% ✅ │
│ next_exam: 2026-11-28(季度重考) │
└────────────────────────────────────────────┘
缺任何一个字段,owner 即为挂名
# generated by hugo AI
这三个字段——考卷(谁出的)、准入线、最近一次考试日期——就是业务负责人从「挂名」走向「实责」的全部凭证。它不应该只是一张表,应该是一段能跑起来的校验——像 #360 里「主管字段缺失则拒绝上岗」一样,台账校验不通过,就该拒绝承认这个 owner:
from dataclasses import dataclass
from datetime import date
@dataclass
class DigitalEmployeeRecord:
"""数字员工绩效台账:麦肯锡三问的最小可执行版本。"""
employee_id: str
role: str
owner: str # 业务负责人
eval_set: str | None = None # 考卷:谁出的、多少题
pass_line: float | None = None # 准入线
last_exam: date | None = None # 最近一次考试日期
def owner_is_real(self) -> bool:
"""三字段齐全,owner 才是实责;否则是挂名。"""
return all([self.eval_set, self.pass_line, self.last_exam])
record = DigitalEmployeeRecord(
employee_id="de-minutes-001",
role="会议纪要专员",
owner="运营总监",
eval_set="50 场历史会议标定卷(运营总监 + 两位业务骨干出题)",
pass_line=0.95,
last_exam=date(2026, 8, 28),
)
assert record.owner_is_real(), "缺任何一个字段,owner 即为挂名"
# generated by hugo AI
盘点数字员工的时候,别只在组织图上加一列 owner;让每个 owner 把这三个字段填出来,让这段校验跑一遍。填不出来的,说明这个 Agent 的责任归属还停留在组织图上,没有落到地面上。
结尾
麦肯锡在 8 月提出了正确的问题:Agent 要有 owner、要考核、要淘汰。这是好事——当这些问题进入经营会议,Agent 才开始真正成为组织的一部分。
但问题清单不等于答案。归属解决「出了事找谁」,测量解决「怎么知道要出事了」。麦肯锡把尺子的制造留白了,而尺子恰恰是让「业务负责人负责」这句话成立的那一层——考卷由业务出,监考由平台做,分数写进台账,退役有体面的出口。
一个留给你组织的问题:你们的数字员工名册上,有多少个员工是「考过试」的?
欢迎留言聊聊。