1918 年夏天,意大利前线,一个奥地利炮兵军官在炮火间隙写完了一本不到三万字的小书。手稿装在背包里跟着他转移阵地;当年 11 月他被意军俘虏,关进战俘营,靠人斡旋才把稿子寄给了罗素,附言是:这些问题,已在一切本质方面获得解决。
这本书是《逻辑哲学论》。写完它,作者做了一件让所有人错愕的事:放弃了彼时欧洲最大的一笔私人遗产之一,跑去奥地利山村当了六年小学教师,然后做修道院园丁,再给姐姐设计了一栋宅子。哲学已经终结了,一个体面的人应该去干点别的。
十年后他改了主意。1929 年 1 月,他重返剑桥,与他同乘一班火车的凯恩斯当天给妻子写了一张字条:
好了,上帝来了。我在 5 点 15 分的火车上碰见了他。
一百年后,另一群人把这句玩笑逐字当真了——只不过这次的「上帝」不搭火车,它在计算集群里。旧金山两家实验室每隔数月更迭一次旗舰模型,而有一篇分析(锦缎研究院《上帝来了》)指出了一件让工程师脊背发凉的事:《逻辑哲学论》的七组命题,几乎是一份大模型的完整技术规格书——语料、嵌入、生成、预测、架构、缩放、对齐,一条不缺。1918 年那个炮兵军官画好的图纸,2020 年代被两个组织不声不响地焊成了机器。
我今天想讲的不是这份图纸有多神,而是图纸的最后一页——那个炮兵军官亲手划下的边界。它恰好回答了这个系列一直在问的问题:当智能变成商品,什么东西不贬值?
一、机器是「事实的总和」,仅此而已
《逻辑哲学论》开篇第一组命题:
1.1 世界是事实的总和,而不是事物的总和。
一百年后,这句话成了预训练的理论定义。大模型学的不是任何名词的「本质」,而是事实——词与词在真实使用中如何组合、共现、排斥。4.26 把它推演到极限:「给出所有真的基本命题,就得到了对世界的完全描述。」翻译过来:把所有人类写下的文本收集、清洗、压缩,就得到了世界本身的可计算形式。
这就是今天所有大模型公司干的事。语料不是原材料,语料是世界的可计算形式。而模型是这份总和的忠实镜像——1.1 说世界是事实的总和,那么可以说:机器,恰好只是事实的总和。
请记住这半句,它是全文的支点。
二、八类资产清单,有一个不够严格的地方
《当智能变得免费,什么东西在涨价》里,我借郭炜那张 slide 列过八类涨价资产:创新、品牌、信任、注意力、客户关系、独有数据、行业 know-how、分发网络。它们的共同点是「难以低成本复制」。
但现在我要对自己这张清单开一刀:「难以复制」是个商业判据,不是严格判据。
独有数据可以卖,know-how 可以写成文档,方法论可以出书,最佳实践可以做成培训课——凡是能被写成文本的东西,原则上都在「事实的总和」里,都能进语料,都能被蒸馏。「难以复制」只说明蒸馏的成本高、时间窗长,不说明蒸不到。
维特根斯坦给出了那个严格版本。第六组命题里,全书最深的一句:
6.41 世界的意义必须在世界之外。在世界中一切如其所在,一切如其所发生;
在世界之中不存在价值——假如存在价值,它就会没有价值。
4.1212 凡是能够显示的,不能被言说。
价值不在事实的总和之中——而机器恰恰只是事实的总和(1.1)。所以 价值不可被语料蒸馏,因为原则上无物可蒸。不是「还没蒸到」,是「不在可蒸的范畴里」。
这给资产判据做了一次升级:
#409 的判据:难以复制的才是资产 (商业角度:复制成本高)
本篇的判据:不可蒸馏的才是资产 (范畴角度:原则上写不进语料)
蒸馏测试:把它完整写成一份文档,交给一个足够强的模型——
它还能剩下什么?
剩下的部分 = 你的保留地
写出来的部分 = 已经在贬值
# generated by hugo AI
三、最强反方:「不可蒸馏」只是「还没数字化」?
写到这里,必须把最强的反方请出来——它几乎是所有技术乐观主义者的标准质疑:
所谓「不可蒸馏」,不过是「还没被数字化」的体面说法。 老师傅的手感?视频语料加触觉传感器正在捕捉。医生的听诊直觉?多模态医疗模型已经在学。母亲对婴儿哭声的分辨?音频模型分辨哭声类别的准确率超过人类。历史上每一次有人说「机器永远学不会 X」,X 都在十年内进了训练集。
这个反方我认一半,而且认得心服口服:凡是能被说出的,迟早会被说出。 视频、音频、动作数据、传感器流——一切「可编码的显示」都在被编码的路上,语料的边疆每年都在外推。这一点上,任何「机器永远学不会」的清单都会过时。
但 6.41 的点不在这。它说的是一个 范畴差异,不是时间差异:
蒸馏能追上的,永远是「已经被说出的」。而活着的实践,在持续产生 尚未被说出的 事实——老师傅今天这一刨子下去的手感,和昨天不一样;医生面对这个具体病人的这一次判断,语料里没有。等这些被记录、被编码、被蒸馏,你已经在活下一个事实了。
维特根斯坦自己在书里写了这条追赶结构:
6.522 确实存在不可言说者。它显示自己。
注意时态:不是「存在尚未被言说者」,是「存在不可言说者」——它 显示 自己,在被言说之前就已经在起作用。蒸馏是对「已显示之物」的事后编码,永远滞后一个身位。而 5.621 把这件事推到底:世界与生命是一。 只要生命还在产生新的、未被说出的事实,人类就还在为机器的世界扩界。
所以反方的正确版本是:边界在移动,是的——但边界不会消失,因为它不是一条画在地图上的线,它是「活的实践」与「已被记录」之间的落差。落差永远存在,只是宽度在变。
四、你写不下来的那三样东西
把判据落到具体的人身上。用蒸馏测试过一遍,会发现一个有点扎心的结果:
你引以为傲的「认知」,大部分已经贬值了。 你总结的方法论、你写的最佳实践、你做的培训课、你的「认知框架」——凡是能写成完整文档的,都在「事实的总和」里,都进得了语料。写下来那一刻,它就同时完成了两件事:传播,和贬值。
真正剩下的,是三类写不下来的东西:
- 手上的分寸——你知道怎么做,但说不清为什么这么做。一说就漏,一漏就错。写进 SOP 的是它的投影,不是它本身。
- 具体的判断——面对这个人、这件事、这个时机的这一次决定。判断的输入是无限维的现场,输出是一句话;能被记录的是那句话,不是那个现场。
- 活着的关系——信任、默契、别人愿意把真话告诉你。4.1212 说凡是能够显示的不能被言说:关系只显示自己,在一次次具体的相处里,写不进任何语料。
这不是安慰,这是判据。它意味着一件事:你的保留地不是你会什么,是你在什么里面活着。 前者是事实的总和,机器已经装下了;后者是显示的过程,机器原则上没有入口。
五、对齐之难,是这个定理的工程证明
最后看一个佐证。AI 行业最难的问题——对齐——为什么这么难?
按 6.41,答案早就写好了:我们试图教给机器的东西(价值),按定义不在机器的世界(事实的总和)里。 RLHF、宪法式 AI、所有对齐方案,共同的理想是「把价值写进机器」——而这在范畴上就不可能一次写成。
所以工程上只能绕道:不定义善,只枚举行为。宪法式 AI 写几百条「你可以做/不可以做」,RLHF 用千万次偏好标注,DPO 用成对样本——全是 4.1212 的工程化:价值无法被言说,只能被显示;那就把「显示」做进流程里。
这正好接上《大模型该在工厂里,不在流水线上》:为什么 evals 和评判标准是组织最值钱的资产?现在有了更深的理由——它们是唯一无法从语料里长出来的东西。语料里有全部事实,没有价值;evals 就是价值在工程世界里的「显示」形式。谁持有 evals,谁持有那把不在事实总和里的尺子。
对齐永远追不完,不是工程不够努力,是 6.41 的定理:显示可以无限逼近,言说永远差一层。这也解释了为什么「对齐」会是 AI 时代最长青的岗位之一——它是人类保留地在机器系统里的派驻机构。
结尾:他会不会在正确的地方沉默
回到开头那个炮兵军官。他后半生亲手拆掉了自己的书:语言不是世界的图像,是工具;意义不在投影关系里,在使用里;语言根植于「生活形式」——那些无法被完全形式化的、活着的实践。第一个运行这套系统、然后发现它边界的人,是作者自己。
《逻辑哲学论》的最后一个命题,七个字:
7 对于不可言说之物,必须保持沉默。
那篇分析文章的结尾说:上帝来了。剩下的问题是,他会不会在正确的地方沉默。
对机器,这是一个安全问题。对你我,这是一个资产问题——而且是同一个问题的两面:
机器的沉默处,是价值的所在;你写不下来的地方,是你的保留地。能被写下来的,都在贬值;只在「做」之中存在的,才是资产。
所以这篇文章本身也在接受它自己的测试:读完它,你记住的如果是这几句判据,那它们已经开始贬值了;真正留下的,是你下一次做决定时,那个说不清但信得过的直觉——那个部分,写不下来,也蒸不走。
你的「写不下来的东西」清单上有什么?欢迎留言聊聊。
(本文引文核对自《逻辑哲学论》Klement 德英对照本;凯恩斯字条转引自 Ray Monk《维特根斯坦传:天才之为责任》;「图纸焊成机器」的完整论证见锦缎研究院《上帝来了:维特根斯坦与 Anthropic、OpenAI 的全部秘密》)