上周发完 一切皆插件:DeepSeek Harness 的野心与收敛鸿沟,一位带研发团队的读者给我发消息:「十次修改能不能收敛,你说取决于 eval。那我们让团队多写点测试用例,是不是就能收敛了?」
「多写点测试」是标准答案,也是错误答案。
它错在把 eval 当成一个纯的工程问题——好像数量上去了,收敛自然就来。但真正决定收敛的,不是 eval 有多少,而是 eval 集长什么样。而 eval 集长什么样,取决于一个更不好量化的东西。
品位。
[Read More]上周发完 一切皆插件:DeepSeek Harness 的野心与收敛鸿沟,一位带研发团队的读者给我发消息:「十次修改能不能收敛,你说取决于 eval。那我们让团队多写点测试用例,是不是就能收敛了?」
「多写点测试」是标准答案,也是错误答案。
它错在把 eval 当成一个纯的工程问题——好像数量上去了,收敛自然就来。但真正决定收敛的,不是 eval 有多少,而是 eval 集长什么样。而 eval 集长什么样,取决于一个更不好量化的东西。
品位。
[Read More]李开复在他的新书《AI 未来已来》里讲了一件微软旧事。
2000 年他升任微软全球副总裁,后来才知道,在他毫不知情的时候,总部一年一度的人才盘点已经把他摆上了桌面——比尔·盖茨和鲍尔默认为他最适合出任一个新事业部的副总裁。他第一次意识到:在这家公司,顶尖人才的去向不是哪个部门领导的家务事,而是最高层亲自过问的大事。
更让他震撼的是制度本身:微软每年把最顶尖的 1% 员工挑出来,不论资历,只看潜力。首席人力资源官告诉他,鲍尔默睡前的功课之一,就是几十份几十份地翻看这些人的资料,确保他们的奖励到位、能感受到最高层的关注。鲍尔默对副总裁们说过一句狠话:
排在前 1% 的人,不属于你们,属于我。我要知道他们都是谁——公司有需求时,我有权随时调动他们。
这是 30 年前的管理智慧:顶尖人才,必须由一号位亲自盯。
但注意它的实现方式——靠鲍尔默的意志力,靠 HR 一年一次的名单。一年一次,几十个人。这已经是人力注意力的极限。而一家几千人的公司里,真正的顶尖人才远不止名单上那几十个人。
李开复写道:2025 年,他在零一万物把这件事重新做了一遍。这一次,用的是「老板 AI」。
[Read More]上个月面试一个候选人。他带了一个 GitHub 项目,说「大部分代码是 AI 写的」。
我说没关系,打开看看。
代码确实漂亮。命名规范,类型标注完整,docstring 齐全,错误处理滴水不漏。如果这是三年前,我会觉得这是一个高级工程师的作品。但现在我知道,这些是任何一个会用 Cursor 的人都能产出的。AI 的默认输出就是 80 分——格式正确、风格一致、看起来专业。
我真正想看的东西,不在代码里。
[Read More]