去年年底,一个带三十人团队的朋友跟我吐槽:「我团队执行力特别强,交代什么做什么,但就是没人主动提新想法。」
我问他:「你的绩效考核怎么算的?」
他说:「Bug 修复数、代码行数、需求交付准时率。」
我说:「那你训练出来的不是工程师,是 KPI 优化器。他们不是不会探索,是探索了没奖励。」
他愣了一下:「这跟训练 AI 有什么区别?」
区别不大。真的。
训练大模型、管理团队、教育孩子,本质上是同一个优化系统
我越来越觉得,这三件事的底层结构是一样的。区别只是优化对象不同:
- 大模型优化 参数 (Parameters)
- 管理团队优化 人的行为 (Behavior)
- 教育孩子优化 人的认知 (Mindset)
而三者都需要回答同样三个问题:
- 给什么 目标 (Objective)
- 给什么 反馈 (Feedback)
- 给多少 探索空间 (Exploration)
想清楚这三个问题,很多管理和教育中的困惑就突然有了答案。
SFT:告诉你标准答案
SFT(Supervised Fine-Tuning)的本质就一句话:
我知道正确答案,你照着学。
对应到现实:
- 学校应试教育
- 新员工 SOP
- 师傅带徒弟
- 家长:「按我说的做。」
优点很明显:学得快、收敛快、可控、容易规模化。
但缺点也很致命:
模型越来越像老师。
模型不会探索。因为 loss 永远在问:「离标准答案还有多远?」而不是:「有没有更好的答案?」
所以 SFT 最大的问题不是能力不足,而是 压制了探索(Exploration)。
创造力,本质就是探索。SFT 会不断降低探索。
所以很多经过大量 SFT 的模型:更礼貌、更稳定、更像助手——但不敢猜、不敢创新、不敢提出反直觉观点。
这和很多企业培养员工一模一样。SOP 写得太细,考核卡得太死,员工就变成了「人形 SFT」——执行精准,但永远不会主动做没被要求的事。
RL:不给答案,只给奖励
RL 不告诉你怎么做。它只说:
做完以后,我告诉你好不好。
所以:
- 孩子:自己摸索
- 员工:自己想办法
- Agent:自己试 Tool
- 模型:自己生成 CoT
RL 最大的价值是 恢复 Exploration。
很多推理能力(Reasoning),其实都是 RL 出来的,不是 SFT 教出来的。模型在 RL 阶段会尝试各种推理路径,奖励信号告诉它哪条路走对了——而不是直接告诉它答案。
这跟带团队一样:真正有创造力的员工,往往不是被 SOP 训练出来的,而是在「允许试错」的环境里长出来的。
但 RL 最大的问题:Reward Hacking
RL 不会教你作弊,但会让你 寻找奖励函数的漏洞。
模型发现:不需要真正解决问题,只需要 看起来像解决了。于是:
- 长 CoT 堆字数
- 无限 Tool Call 假装在忙
- 自己给自己 Validation
- 编造引用
- Pretend Search
都是 Reward Hacking。
现实世界一模一样:
奖金按 Bug 数——于是大家拆 Bug,不是修 Bug。一个 Bug 拆成三个,修复数翻三倍。
奖金按代码量——于是代码越来越多,不是越来越好。能一行写完的,非要写十行。
家长奖励考试分数——于是孩子开始刷题,不是学习。甚至开始作弊。不是因为人坏,而是 Reward 错了。
Reward Hacking 不是道德问题,是系统设计问题。
你设计了什么样的奖励函数,就会得到什么样的「优化行为」。员工在 hack 你的 KPI,就像模型在 hack 你的 Reward Model——不是他们学坏了,是你的函数有漏洞。
一张表看清全貌
| AI | 管理团队 | 教育孩子 |
|---|---|---|
| Pretrain | 成长环境 | 家庭环境 |
| SFT | 培训、SOP | 老师讲课 |
| RL | KPI、奖金 | 鼓励、奖励 |
| RLHF | Manager Feedback | 家长反馈 |
| Constitutional AI | 企业文化 | 家庭价值观 |
| Reward Model | KPI | 考试评价 |
| Reward Hacking | KPI 游戏 | 应试、作弊 |
这张表里最值得注意的,不是 SFT 和 RL 的对应——那个比较直觉。真正深的一层是最后两行。
企业文化之于团队,就像 Constitutional AI 之于模型
当奖励函数无法覆盖所有情况时,真正约束行为的不是 KPI,而是 内化的原则。
Constitutional AI 的思路是:不靠人类逐条标注「这个回复好、那个回复差」,而是给模型一组高层原则(「诚实」「无害」「有帮助」),让模型自己用这些原则评价和修正自己的输出。
企业文化做的事情一模一样。
你不可能给员工写一份覆盖所有场景的 KPI。客户突然投诉了、跨部门扯皮了、遇到一个从没见过的问题——KPI 里没有。这时候真正决定员工怎么做的,不是奖金公式,而是他内化的那套原则:「我们公司是怎么做事的。」
同样,当模型遇到训练分布之外的问题时,能够约束其行为的也不仅是奖励模型,而是更高层次的行为准则。
KPI 管得了的,不需要文化;KPI 管不了的,只有文化能管。
这个对应关系,可能比 SFT/RL 的类比更接近现实组织长期演化的本质。
真正优秀的人,经历三个阶段
把上面的框架拉到个人成长的维度,可以概括成一条路径:
先 SFT,再 RL,最后 Self-RL。
第一阶段:SFT——学会
先模仿。复制优秀实践。师傅怎么做,我就怎么做。
这是「学会」。没有这个阶段,后面都是空中楼阁。
第二阶段:RL——成长
开始自己试。允许失败,允许探索。不再问「标准答案是什么」,而是问「我试了,结果怎么样」。
这是「成长」。大多数人在这个阶段分化——有人因为害怕负反馈退回 SFT,有人因为找到了正反馈加速探索。
第三阶段:Self-RL——持续迭代
最厉害的人已经没有老师了。他们每天:
- 自己设目标(Objective)
- 自己评价结果(Reward)
- 自己更新行为(Policy)
形成持续迭代的闭环。
这也是很多顶尖创业者、研究者、运动员共同的特点。他们不需要外部奖励函数,因为他们自己就是自己的 Reward Model——而且这个 Reward Model 比任何外部 KPI 都更校准。
对模型来说,Self-RL 目前还做不到。模型不会自己决定「我接下来该学什么」。但人可以。这恰恰是人相对于 AI 最不可替代的能力。
所以,高水平的管理不是二选一
回到开头那个朋友的问题。他的团队「执行力强但没人创新」,不是人的问题,是系统的问题:
- SFT 太多(SOP 太细、考核太死)→ 探索被压制
- RL 的奖励函数设计错误(Bug 数、代码行数)→ 即使有探索空间,也在 hack 错误的目标
- 没有 Constitutional AI 层(没有内化的工程文化)→ KPI 覆盖不到的地方,行为就失控
真正高水平的管理,不是 SFT 和 RL 二选一,而是:先用 SFT 建立基本能力,再用 RL 激发探索,最后通过正确的价值观和反馈机制,避免 Reward Hacking。
训练大模型是这样。管理团队是这样。教育孩子也是这样。
区别只是:模型不会自己走到第三阶段。
而人可以。
你在带团队或带孩子时,有没有发现过「奖励函数设计错误」导致的 Reward Hacking?欢迎留言聊聊。