私有 Eval 是终极护城河

Private Evals Are the Ultimate Moat

上个月和一位做 HR SaaS 的朋友吃饭。他刚花了两百万买了一批行业测评数据,准备训练自己的垂直模型。

我问他:「竞品如果也买同样的数据呢?」

他愣了一下:「那……我们还有先发优势。」

「先发多少?」

「大概……半年?」

半年。这就是原始数据作为护城河的保质期。

三个月前,我写了一篇 中国 SaaS 厂商的护城河应该怎么建,核心公式是:

护城河 = 垂直行业数据资产 × 行业 Know-How × 客户成功体系 × 生态协同

那篇文章里,我把「数据壁垒」放在七大维度的第一位,画了一个数据飞轮:客户使用 → 数据沉淀 → 模型训练 → 更精准的服务 → 更多客户使用。

三个月后,我要修正自己。

飞轮里转的不是数据,是 eval。

Private Evals Are the Ultimate Moat

一、数据不是护城河,判断力才是

先说一个让我改变想法的事实。

2026 年 4 月,cal.com 把生产代码转为私有,关闭了开源仓库。原因不是有人 fork 了他们的代码,而是 AI 可以读取公开源码,枚举所有攻击面,然后用一个周末 + $40 API 成本,蒸馏出一个功能等价的竞品

这不是个案。Loss Function Development(LFD)的实践者发现了一个更普遍的规律:

「在软件的整个历史里,‘我们构建了它’曾经就是护城河。那个时代正在结束。」

当信息对称时,执行成本坍缩至接近零。公开代码、公开产品、公开数据——任何 Agent 可以看到的东西,都可以在一个周末被蒸馏掉。

那什么蒸馏不掉?

「去构建那个周末无法触碰的 eval。」

私有 eval set。真实用户的边缘场景。私下测量的 ground truth。 你的竞争对手的 Agent 看不到的目标。

这就是信息不对称护城河——不是你有数据,而是你对「什么算好」有独家的、经过实战验证的判断标准。

二、原始数据是原材料,eval 是制成品

回到我上一篇文章里的数据飞轮。那个逻辑有没有错?没有。但它不够精确。

北森积累了 5000 万+ 测评数据、200 万+ 岗位胜任力模型。这是数据。但北森真正的壁垒不是这 5000 万条数据本身——原始数据可以采购,行业报告可以买,爬虫可以抓。

北森真正的壁垒是: 这 5000 万条数据蒸馏出的「什么算好简历」的判断标准。 哪些特征组合预测高绩效,哪些评估维度区分岗位胜任力,哪些边界条件下通用模型会误判——这些判断标准,就是 eval。

数据(原材料)                    Eval(制成品)
─────────────────────            ─────────────────────
5000 万条测评记录                 「什么算好简历」的判断标准
200 万岗位描述                    「什么算岗位匹配」的评分函数
10 年客户反馈                     「什么算客户满意」的验证集

可以采购                          不能采购
可以爬取                          不能爬取
可以蒸馏                          蒸馏需要同等体量的实战反馈

一个类比:石油是原材料,谁都能买。但炼油厂的工艺参数——温度、压力、催化剂配比——是制成品。竞争对手可以买到同样的原油,但复制不了你的炼油工艺。

数据是原油,eval 是炼油工艺。

三、学习闭环里,Eval 是承上启下的环节

我在内部写 AI 钉钉战略时,画过一个学习闭环:

Context → Agent → Action → Feedback → Eval → Memory → Skill
   ↑                                                        │
   └────────────── 越来越懂企业 ──────────────────────────────┘
# generated by hugo AI

这个闭环里,Eval 的位置很特殊——它是 Feedback 和 Memory 之间的过滤器

没有 Eval 的闭环:

Feedback(原始反馈)→ 直接写入 Memory → 污染

有 Eval 的闭环:

Feedback(原始反馈)→ Eval(判断:这条反馈是否代表真正的「好」)→ Memory → 复利

Nadella 在「反向信息悖论」里说了一句让我很有共鸣的话:

「企业为 AI 付了两次钱——一次用钱买模型,一次用专有知识喂模型。」

企业最深层的焦虑是: 我的 AI 越来越懂我,但这些「越来越懂」是不是属于我?

真正敏感的不是数据本身,而是 智能尾气(Intelligence Exhaust)——每一次纠错、每一条 trace、每一次 eval、每一句 prompt 修正。这些日积月累蒸馏成的机构知识,才是竞争对手花钱也买不到的东西。

所以 AI 钉钉要回答的问题不是「用哪个模型」,而是:

知识归谁。学习资产在哪里运行。由谁托管。是否始终归企业所有。

Eval 是学习资产的核心。因为 eval 就是「什么算好」的编码化——它比原始数据更浓缩、比模型权重更可迁移、比 prompt 更稳定。

四、钉钉的结构性优势:坐在产生 Eval 的闭环上

我在上一篇文章里说,钉钉的护城河是「垂直行业数据资产」。现在我要更精确地说:

钉钉的结构性优势不是「坐在数据上」,而是「坐在产生 eval 的闭环上」。

┌─────────────────────────────────────────────────┐
│              钉钉学习闭环                         │
│                                                  │
│  组织上下文(IM/审批/日程/文档/通讯录)            │
│       ↓                                          │
│  Agent 执行(数字员工 7×24 运行)                 │
│       ↓                                          │
│  业务反馈(人工纠错/确认/驳回/修改)              │
│       ↓                                          │
│  Eval 沉淀(什么算好 → 编码为验证标准)           │
│       ↓                                          │
│  Memory / Skill(越来越懂这家企业)               │
│       ↓                                          │
│  下一次执行更准确 → 更多反馈 → 更好的 eval        │
│                                                  │
│  这个闭环在每家企业每天转无数次                    │
│  每转一次,eval 就厚一层                          │
└─────────────────────────────────────────────────┘
# generated by hugo AI

Slack 有 IM。飞书有文档。但钉钉有 IM + 审批 + 表格 + 通讯录 + 工作流 + 日历 的完整上下文。这意味着钉钉上的 Agent 每一次执行,都能获得最完整的业务反馈——而每一次反馈,都是 eval 的原材料。

竞争对手可以做一个功能相同的 Agent。但它拿不到钉钉上每天海量「人工纠错」产生的 eval(具体量级取决于 Agent 渗透率,但钉钉的组织上下文覆盖面是结构性的)。这些纠错不是数据——它们是 判断。是「这个审批应该加审」「这条消息不应该在这个时间发」「这个日程冲突应该优先保谁」的判断。

判断不能采购,只能积累。

五、Intelligence Custodian:托管的不是数据,是 Eval

我在内部备忘录里给 AI 钉钉的定位是:

AI 钉钉 = 企业最值得信任的智能资产托管者(Intelligence Custodian)

现在我要把这个定位再推进一步:

Intelligence Custodian 托管的核心资产,不是数据,不是模型,是 eval

为什么?

资产类型可迁移性可复制性价值密度
原始数据高(可导出)高(可采购)
模型权重中(可换)中(可微调)
Prompt / Skill高(可复制)高(可蒸馏)
Eval Set高(可导出)低(需实战积累)

Eval 是唯一同时满足「高价值密度」和「低可复制性」的资产。

而且 eval 天然需要托管——它需要版本控制(v1 的「好」和 v2 的「好」可能不同)、需要审计(谁改了什么标准、为什么改)、需要权限(哪些 eval 是部门级的、哪些是企业级的)、需要迁移(换模型时 eval 不动)。

这些恰好是钉钉 Runtime 擅长的事情:Identity、Permission、Audit、Version、Export。

┌─────────────────────────────────┐
│         企业上下文               │
│  组织/权限/IM/会议/审批/文档     │
├─────────────────────────────────┤
│        DingTalk Runtime         │
│  Identity / Memory / Workflow   │
│  Skill / Tool / Permission      │
│  Trace / Eval / Feedback        │  ← Eval 在这里
│  Audit / Knowledge / Learning   │
├─────────────────────────────────┤
│        Model Adapter            │
│  Claude | GPT | Qwen | DeepSeek │  ← 模型随便换
├─────────────────────────────────┤
│        Foundation Model         │
└─────────────────────────────────┘
# generated by hugo AI

模型可以替换。Runtime 不动。 Eval 一直都在。

六、修正后的护城河公式

所以,我要修正三个月前的公式:

旧公式:
护城河 = 垂直行业数据资产 × 行业 Know-How × 客户成功体系 × 生态协同

新公式:
护城河 = 私有 Eval 资产 × 学习闭环转速 × 行业 Know-How × 生态协同

变化在哪?

  1. 「垂直行业数据资产」→「私有 Eval 资产」:数据是原材料,eval 是制成品。护城河是制成品,不是原材料
  2. 新增「学习闭环转速」:eval 不是静态资产,它需要持续积累。闭环转得越快,eval 越厚,护城河越深。钉钉每天几百万次 Agent 执行 × 人工反馈,这个转速是结构性优势
  3. 「客户成功体系」被吸收进「学习闭环转速」:客户成功的核心价值不再是「教客户用软件」,而是「让闭环转起来」

三个关键判断:

  1. 公开产物可以被蒸馏,私有 eval 不能——因为 eval 需要同等体量的实战反馈才能构建,这不是一个周末 + $40 能做到的
  2. 模型越强,eval 越值钱——模型能力是公共品,eval 是私有品。公共品越强,私有品的杠杆越大
  3. 谁坐在闭环上,谁拥有护城河——不是谁有数据,是谁每天在产生新的 eval

七、一个思想实验

假设明天有一家新公司,拿到了和钉钉一样多的企业数据(通过某种合法途径),训练了一个一样强的模型。它能复制钉钉的 Agent 能力吗?

能。一个周末就够。

它能复制钉钉的 eval 吗?

不能。因为钉钉的 eval 不是从数据里训练出来的,是从 几百万家企业、每天几百万次「这个不对,应该是那样」的人工纠错 里蒸馏出来的。这些纠错发生在真实的业务场景里,带着真实的组织上下文,由真实的业务专家做出。

你可以买到同样的原油。但你买不到炼油厂十年积累的工艺参数。

私有 eval,是 Agent 时代的炼油工艺。

你在构建自己的 eval 资产吗?还是还在囤数据?欢迎留言讨论。


See also