上个月和一位做 HR SaaS 的朋友吃饭。他刚花了两百万买了一批行业测评数据,准备训练自己的垂直模型。
我问他:「竞品如果也买同样的数据呢?」
他愣了一下:「那……我们还有先发优势。」
「先发多少?」
「大概……半年?」
半年。这就是原始数据作为护城河的保质期。
三个月前,我写了一篇 中国 SaaS 厂商的护城河应该怎么建,核心公式是:
护城河 = 垂直行业数据资产 × 行业 Know-How × 客户成功体系 × 生态协同
那篇文章里,我把「数据壁垒」放在七大维度的第一位,画了一个数据飞轮:客户使用 → 数据沉淀 → 模型训练 → 更精准的服务 → 更多客户使用。
三个月后,我要修正自己。
飞轮里转的不是数据,是 eval。
一、数据不是护城河,判断力才是
先说一个让我改变想法的事实。
2026 年 4 月,cal.com 把生产代码转为私有,关闭了开源仓库。原因不是有人 fork 了他们的代码,而是 AI 可以读取公开源码,枚举所有攻击面,然后用一个周末 + $40 API 成本,蒸馏出一个功能等价的竞品。
这不是个案。Loss Function Development(LFD)的实践者发现了一个更普遍的规律:
「在软件的整个历史里,‘我们构建了它’曾经就是护城河。那个时代正在结束。」
当信息对称时,执行成本坍缩至接近零。公开代码、公开产品、公开数据——任何 Agent 可以看到的东西,都可以在一个周末被蒸馏掉。
那什么蒸馏不掉?
「去构建那个周末无法触碰的 eval。」
私有 eval set。真实用户的边缘场景。私下测量的 ground truth。 你的竞争对手的 Agent 看不到的目标。
这就是信息不对称护城河——不是你有数据,而是你对「什么算好」有独家的、经过实战验证的判断标准。
二、原始数据是原材料,eval 是制成品
回到我上一篇文章里的数据飞轮。那个逻辑有没有错?没有。但它不够精确。
北森积累了 5000 万+ 测评数据、200 万+ 岗位胜任力模型。这是数据。但北森真正的壁垒不是这 5000 万条数据本身——原始数据可以采购,行业报告可以买,爬虫可以抓。
北森真正的壁垒是: 这 5000 万条数据蒸馏出的「什么算好简历」的判断标准。 哪些特征组合预测高绩效,哪些评估维度区分岗位胜任力,哪些边界条件下通用模型会误判——这些判断标准,就是 eval。
数据(原材料) Eval(制成品)
───────────────────── ─────────────────────
5000 万条测评记录 「什么算好简历」的判断标准
200 万岗位描述 「什么算岗位匹配」的评分函数
10 年客户反馈 「什么算客户满意」的验证集
可以采购 不能采购
可以爬取 不能爬取
可以蒸馏 蒸馏需要同等体量的实战反馈
一个类比:石油是原材料,谁都能买。但炼油厂的工艺参数——温度、压力、催化剂配比——是制成品。竞争对手可以买到同样的原油,但复制不了你的炼油工艺。
数据是原油,eval 是炼油工艺。
三、学习闭环里,Eval 是承上启下的环节
我在内部写 AI 钉钉战略时,画过一个学习闭环:
Context → Agent → Action → Feedback → Eval → Memory → Skill
↑ │
└────────────── 越来越懂企业 ──────────────────────────────┘
# generated by hugo AI
这个闭环里,Eval 的位置很特殊——它是 Feedback 和 Memory 之间的过滤器。
没有 Eval 的闭环:
Feedback(原始反馈)→ 直接写入 Memory → 污染
有 Eval 的闭环:
Feedback(原始反馈)→ Eval(判断:这条反馈是否代表真正的「好」)→ Memory → 复利
Nadella 在「反向信息悖论」里说了一句让我很有共鸣的话:
「企业为 AI 付了两次钱——一次用钱买模型,一次用专有知识喂模型。」
企业最深层的焦虑是: 我的 AI 越来越懂我,但这些「越来越懂」是不是属于我?
真正敏感的不是数据本身,而是 智能尾气(Intelligence Exhaust)——每一次纠错、每一条 trace、每一次 eval、每一句 prompt 修正。这些日积月累蒸馏成的机构知识,才是竞争对手花钱也买不到的东西。
所以 AI 钉钉要回答的问题不是「用哪个模型」,而是:
知识归谁。学习资产在哪里运行。由谁托管。是否始终归企业所有。
Eval 是学习资产的核心。因为 eval 就是「什么算好」的编码化——它比原始数据更浓缩、比模型权重更可迁移、比 prompt 更稳定。
四、钉钉的结构性优势:坐在产生 Eval 的闭环上
我在上一篇文章里说,钉钉的护城河是「垂直行业数据资产」。现在我要更精确地说:
钉钉的结构性优势不是「坐在数据上」,而是「坐在产生 eval 的闭环上」。
┌─────────────────────────────────────────────────┐
│ 钉钉学习闭环 │
│ │
│ 组织上下文(IM/审批/日程/文档/通讯录) │
│ ↓ │
│ Agent 执行(数字员工 7×24 运行) │
│ ↓ │
│ 业务反馈(人工纠错/确认/驳回/修改) │
│ ↓ │
│ Eval 沉淀(什么算好 → 编码为验证标准) │
│ ↓ │
│ Memory / Skill(越来越懂这家企业) │
│ ↓ │
│ 下一次执行更准确 → 更多反馈 → 更好的 eval │
│ │
│ 这个闭环在每家企业每天转无数次 │
│ 每转一次,eval 就厚一层 │
└─────────────────────────────────────────────────┘
# generated by hugo AI
Slack 有 IM。飞书有文档。但钉钉有 IM + 审批 + 表格 + 通讯录 + 工作流 + 日历 的完整上下文。这意味着钉钉上的 Agent 每一次执行,都能获得最完整的业务反馈——而每一次反馈,都是 eval 的原材料。
竞争对手可以做一个功能相同的 Agent。但它拿不到钉钉上每天海量「人工纠错」产生的 eval(具体量级取决于 Agent 渗透率,但钉钉的组织上下文覆盖面是结构性的)。这些纠错不是数据——它们是 判断。是「这个审批应该加审」「这条消息不应该在这个时间发」「这个日程冲突应该优先保谁」的判断。
判断不能采购,只能积累。
五、Intelligence Custodian:托管的不是数据,是 Eval
我在内部备忘录里给 AI 钉钉的定位是:
AI 钉钉 = 企业最值得信任的智能资产托管者(Intelligence Custodian)
现在我要把这个定位再推进一步:
Intelligence Custodian 托管的核心资产,不是数据,不是模型,是 eval。
为什么?
| 资产类型 | 可迁移性 | 可复制性 | 价值密度 |
|---|---|---|---|
| 原始数据 | 高(可导出) | 高(可采购) | 低 |
| 模型权重 | 中(可换) | 中(可微调) | 中 |
| Prompt / Skill | 高(可复制) | 高(可蒸馏) | 中 |
| Eval Set | 高(可导出) | 低(需实战积累) | 高 |
Eval 是唯一同时满足「高价值密度」和「低可复制性」的资产。
而且 eval 天然需要托管——它需要版本控制(v1 的「好」和 v2 的「好」可能不同)、需要审计(谁改了什么标准、为什么改)、需要权限(哪些 eval 是部门级的、哪些是企业级的)、需要迁移(换模型时 eval 不动)。
这些恰好是钉钉 Runtime 擅长的事情:Identity、Permission、Audit、Version、Export。
┌─────────────────────────────────┐
│ 企业上下文 │
│ 组织/权限/IM/会议/审批/文档 │
├─────────────────────────────────┤
│ DingTalk Runtime │
│ Identity / Memory / Workflow │
│ Skill / Tool / Permission │
│ Trace / Eval / Feedback │ ← Eval 在这里
│ Audit / Knowledge / Learning │
├─────────────────────────────────┤
│ Model Adapter │
│ Claude | GPT | Qwen | DeepSeek │ ← 模型随便换
├─────────────────────────────────┤
│ Foundation Model │
└─────────────────────────────────┘
# generated by hugo AI
模型可以替换。Runtime 不动。 Eval 一直都在。
六、修正后的护城河公式
所以,我要修正三个月前的公式:
旧公式:
护城河 = 垂直行业数据资产 × 行业 Know-How × 客户成功体系 × 生态协同
新公式:
护城河 = 私有 Eval 资产 × 学习闭环转速 × 行业 Know-How × 生态协同
变化在哪?
- 「垂直行业数据资产」→「私有 Eval 资产」:数据是原材料,eval 是制成品。护城河是制成品,不是原材料
- 新增「学习闭环转速」:eval 不是静态资产,它需要持续积累。闭环转得越快,eval 越厚,护城河越深。钉钉每天几百万次 Agent 执行 × 人工反馈,这个转速是结构性优势
- 「客户成功体系」被吸收进「学习闭环转速」:客户成功的核心价值不再是「教客户用软件」,而是「让闭环转起来」
三个关键判断:
- 公开产物可以被蒸馏,私有 eval 不能——因为 eval 需要同等体量的实战反馈才能构建,这不是一个周末 + $40 能做到的
- 模型越强,eval 越值钱——模型能力是公共品,eval 是私有品。公共品越强,私有品的杠杆越大
- 谁坐在闭环上,谁拥有护城河——不是谁有数据,是谁每天在产生新的 eval
七、一个思想实验
假设明天有一家新公司,拿到了和钉钉一样多的企业数据(通过某种合法途径),训练了一个一样强的模型。它能复制钉钉的 Agent 能力吗?
能。一个周末就够。
它能复制钉钉的 eval 吗?
不能。因为钉钉的 eval 不是从数据里训练出来的,是从 几百万家企业、每天几百万次「这个不对,应该是那样」的人工纠错 里蒸馏出来的。这些纠错发生在真实的业务场景里,带着真实的组织上下文,由真实的业务专家做出。
你可以买到同样的原油。但你买不到炼油厂十年积累的工艺参数。
私有 eval,是 Agent 时代的炼油工艺。
你在构建自己的 eval 资产吗?还是还在囤数据?欢迎留言讨论。