<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Llm-Training on All about Raspberry Pi</title><link>https://hugozhu.site/tags/llm-training/</link><description>Recent content in Llm-Training on All about Raspberry Pi</description><generator>Hugo</generator><language>en</language><lastBuildDate>Wed, 22 Jul 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://hugozhu.site/tags/llm-training/index.xml" rel="self" type="application/rss+xml"/><item><title>SFT、RL 与 Self-RL：从大模型训练到团队管理的优化系统</title><link>https://hugozhu.site/post/2026/305-sft-rl-self-rl-optimization-system/</link><pubDate>Wed, 22 Jul 2026 00:00:00 +0000</pubDate><guid>https://hugozhu.site/post/2026/305-sft-rl-self-rl-optimization-system/</guid><description>&lt;p&gt;去年年底，一个带三十人团队的朋友跟我吐槽：「我团队执行力特别强，交代什么做什么，但就是没人主动提新想法。」&lt;/p&gt;
&lt;p&gt;我问他：「你的绩效考核怎么算的？」&lt;/p&gt;
&lt;p&gt;他说：「Bug 修复数、代码行数、需求交付准时率。」&lt;/p&gt;
&lt;p&gt;我说：「那你训练出来的不是工程师，是 KPI 优化器。他们不是不会探索，是探索了没奖励。」&lt;/p&gt;
&lt;p&gt;他愣了一下：「这跟训练 AI 有什么区别？」&lt;/p&gt;
&lt;p&gt;区别不大。真的。&lt;/p&gt;</description></item></channel></rss>