SFT、RL 与 Self-RL:从大模型训练到团队管理的优化系统

Training LLMs, Managing Teams, Raising Kids — Same Optimization System

去年年底,一个带三十人团队的朋友跟我吐槽:「我团队执行力特别强,交代什么做什么,但就是没人主动提新想法。」

我问他:「你的绩效考核怎么算的?」

他说:「Bug 修复数、代码行数、需求交付准时率。」

我说:「那你训练出来的不是工程师,是 KPI 优化器。他们不是不会探索,是探索了没奖励。」

他愣了一下:「这跟训练 AI 有什么区别?」

区别不大。真的。

[Read More]