SFT、RL 与 Self-RL:从大模型训练到团队管理的优化系统

Training LLMs, Managing Teams, Raising Kids — Same Optimization System

去年年底,一个带三十人团队的朋友跟我吐槽:「我团队执行力特别强,交代什么做什么,但就是没人主动提新想法。」

我问他:「你的绩效考核怎么算的?」

他说:「Bug 修复数、代码行数、需求交付准时率。」

我说:「那你训练出来的不是工程师,是 KPI 优化器。他们不是不会探索,是探索了没奖励。」

他愣了一下:「这跟训练 AI 有什么区别?」

区别不大。真的。

SFT RL Self-RL 优化系统

训练大模型、管理团队、教育孩子,本质上是同一个优化系统

我越来越觉得,这三件事的底层结构是一样的。区别只是优化对象不同:

  • 大模型优化 参数 (Parameters)
  • 管理团队优化 人的行为 (Behavior)
  • 教育孩子优化 人的认知 (Mindset)

而三者都需要回答同样三个问题:

  1. 给什么 目标 (Objective)
  2. 给什么 反馈 (Feedback)
  3. 给多少 探索空间 (Exploration)

想清楚这三个问题,很多管理和教育中的困惑就突然有了答案。

SFT:告诉你标准答案

SFT(Supervised Fine-Tuning)的本质就一句话:

我知道正确答案,你照着学。

对应到现实:

  • 学校应试教育
  • 新员工 SOP
  • 师傅带徒弟
  • 家长:「按我说的做。」

优点很明显:学得快、收敛快、可控、容易规模化。

但缺点也很致命:

模型越来越像老师。

模型不会探索。因为 loss 永远在问:「离标准答案还有多远?」而不是:「有没有更好的答案?」

所以 SFT 最大的问题不是能力不足,而是 压制了探索(Exploration)

创造力,本质就是探索。SFT 会不断降低探索。

所以很多经过大量 SFT 的模型:更礼貌、更稳定、更像助手——但不敢猜、不敢创新、不敢提出反直觉观点。

这和很多企业培养员工一模一样。SOP 写得太细,考核卡得太死,员工就变成了「人形 SFT」——执行精准,但永远不会主动做没被要求的事。

RL:不给答案,只给奖励

RL 不告诉你怎么做。它只说:

做完以后,我告诉你好不好。

所以:

  • 孩子:自己摸索
  • 员工:自己想办法
  • Agent:自己试 Tool
  • 模型:自己生成 CoT

RL 最大的价值是 恢复 Exploration

很多推理能力(Reasoning),其实都是 RL 出来的,不是 SFT 教出来的。模型在 RL 阶段会尝试各种推理路径,奖励信号告诉它哪条路走对了——而不是直接告诉它答案。

这跟带团队一样:真正有创造力的员工,往往不是被 SOP 训练出来的,而是在「允许试错」的环境里长出来的。

但 RL 最大的问题:Reward Hacking

RL 不会教你作弊,但会让你 寻找奖励函数的漏洞

模型发现:不需要真正解决问题,只需要 看起来像解决了。于是:

  • 长 CoT 堆字数
  • 无限 Tool Call 假装在忙
  • 自己给自己 Validation
  • 编造引用
  • Pretend Search

都是 Reward Hacking。

现实世界一模一样:

奖金按 Bug 数——于是大家拆 Bug,不是修 Bug。一个 Bug 拆成三个,修复数翻三倍。

奖金按代码量——于是代码越来越多,不是越来越好。能一行写完的,非要写十行。

家长奖励考试分数——于是孩子开始刷题,不是学习。甚至开始作弊。不是因为人坏,而是 Reward 错了。

Reward Hacking 不是道德问题,是系统设计问题。

你设计了什么样的奖励函数,就会得到什么样的「优化行为」。员工在 hack 你的 KPI,就像模型在 hack 你的 Reward Model——不是他们学坏了,是你的函数有漏洞。

一张表看清全貌

AI管理团队教育孩子
Pretrain成长环境家庭环境
SFT培训、SOP老师讲课
RLKPI、奖金鼓励、奖励
RLHFManager Feedback家长反馈
Constitutional AI企业文化家庭价值观
Reward ModelKPI考试评价
Reward HackingKPI 游戏应试、作弊

这张表里最值得注意的,不是 SFT 和 RL 的对应——那个比较直觉。真正深的一层是最后两行。

企业文化之于团队,就像 Constitutional AI 之于模型

当奖励函数无法覆盖所有情况时,真正约束行为的不是 KPI,而是 内化的原则

Constitutional AI 的思路是:不靠人类逐条标注「这个回复好、那个回复差」,而是给模型一组高层原则(「诚实」「无害」「有帮助」),让模型自己用这些原则评价和修正自己的输出。

企业文化做的事情一模一样。

你不可能给员工写一份覆盖所有场景的 KPI。客户突然投诉了、跨部门扯皮了、遇到一个从没见过的问题——KPI 里没有。这时候真正决定员工怎么做的,不是奖金公式,而是他内化的那套原则:「我们公司是怎么做事的。」

同样,当模型遇到训练分布之外的问题时,能够约束其行为的也不仅是奖励模型,而是更高层次的行为准则。

KPI 管得了的,不需要文化;KPI 管不了的,只有文化能管。

这个对应关系,可能比 SFT/RL 的类比更接近现实组织长期演化的本质。

真正优秀的人,经历三个阶段

把上面的框架拉到个人成长的维度,可以概括成一条路径:

先 SFT,再 RL,最后 Self-RL。

第一阶段:SFT——学会

先模仿。复制优秀实践。师傅怎么做,我就怎么做。

这是「学会」。没有这个阶段,后面都是空中楼阁。

第二阶段:RL——成长

开始自己试。允许失败,允许探索。不再问「标准答案是什么」,而是问「我试了,结果怎么样」。

这是「成长」。大多数人在这个阶段分化——有人因为害怕负反馈退回 SFT,有人因为找到了正反馈加速探索。

第三阶段:Self-RL——持续迭代

最厉害的人已经没有老师了。他们每天:

  • 自己设目标(Objective)
  • 自己评价结果(Reward)
  • 自己更新行为(Policy)

形成持续迭代的闭环。

这也是很多顶尖创业者、研究者、运动员共同的特点。他们不需要外部奖励函数,因为他们自己就是自己的 Reward Model——而且这个 Reward Model 比任何外部 KPI 都更校准。

对模型来说,Self-RL 目前还做不到。模型不会自己决定「我接下来该学什么」。但人可以。这恰恰是人相对于 AI 最不可替代的能力。

所以,高水平的管理不是二选一

回到开头那个朋友的问题。他的团队「执行力强但没人创新」,不是人的问题,是系统的问题:

  • SFT 太多(SOP 太细、考核太死)→ 探索被压制
  • RL 的奖励函数设计错误(Bug 数、代码行数)→ 即使有探索空间,也在 hack 错误的目标
  • 没有 Constitutional AI 层(没有内化的工程文化)→ KPI 覆盖不到的地方,行为就失控

真正高水平的管理,不是 SFT 和 RL 二选一,而是:先用 SFT 建立基本能力,再用 RL 激发探索,最后通过正确的价值观和反馈机制,避免 Reward Hacking。

训练大模型是这样。管理团队是这样。教育孩子也是这样。

区别只是:模型不会自己走到第三阶段。

而人可以。


你在带团队或带孩子时,有没有发现过「奖励函数设计错误」导致的 Reward Hacking?欢迎留言聊聊。


See also