用 1% 法则,给你的公司做一次 AI 盘点

Auditing Your Company's AI Opportunities With the 1% Rule

最近一个月,有三个人问过我同一个问题:「我们公司想做 AI,从哪开始?」

三个人的背景很不一样:一个做制造,一个做跨境电商,一个做连锁餐饮。但他们的第一反应惊人地一致:先看看现在的模型能干什么,再从公司里找个场景套上去。

Jeff Dean 给的答案正好相反。今年 YC Startup School 上,他给了一个我认为值得每个企业贴在墙上的选题标准:

去找模型成功率是 0% 或 1% 的问题,不是 20%。

这就是 1% 法则。在 AI 的竞争变了:未来是上下文的竞争 里我讲过这个判断的战略含义;这篇往前一步——把它变成一套你在自己公司就能执行的盘点方法。

Auditing Your Company’s AI Opportunities With the 1% Rule

一、为什么 20% 反而是危险信号

先说反直觉的部分。

直觉上,「模型已经能做对 20%」应该是个好消息:说明能力萌芽了,再投入一些工程、再喂一些数据,说不定就能做到 80%。很多企业的 AI 项目就是这么立项的。

Dean 的判断恰好相反。他的原话是:如果模型对某个问题「能做一点但做得不好」,这 不是 好信号——「这多半说明这个能力已经在模型里萌芽了。更多的训练数据、更大的规模,会让它继续变好」。也就是说,你今天花大力气把 20% 优化到 60%,很可能是在替模型厂商做嫁衣:六个月到十二个月后,下一个版本的基座模型会把这个能力直接吃掉,你的工程投入一夜归零。

反过来,模型成功率 0% 或 1% 的地方,说明模型 从根本上 做不了——而不是暂时做不了。这才是值得投入的位置。

二、模型为什么会彻底失败:拿不到,和没见过

模型什么时候会彻底做不了一件事?Dean 给了两个原因:

  1. 拿不到——你的产品能访问某些数据,而通用模型没有权限。他举的例子是整理个人信息的工具:「你的模型或产品能看见重要数据,而通用模型没有访问权,这一下你就有了巨大优势。」
  2. 没见过——通用模型的训练集里没有这个分布,但你可以用得起一份小而准的专用模型。

对照到企业场景,第一条几乎就是为「私有上下文」量身定做的。你的组织架构、审批流、客户记录、决策历史,都在你的系统里,隔着你的权限体系——通用模型连门都进不了。而且正如我在 AI 的竞争变了 里论证的: 这是访问权问题,不是能力问题。 模型再进化,也无权访问你不想开放的东西。所以由「拿不到」造成的 0%,是持续的 0%——这正是盘点的价值所在。

第二条「没见过」要小心一些:专用模型能补上的分布缺口,基座模型迟早也能补上。所以盘点时要区分:这个 0% 是因为数据锁在你的权限后面(持续),还是因为训练还不够(暂时)。

三、盘点四步法

方法本身不复杂,需要的是动手。

第一步:列任务清单。 把公司里高频、重复、输出明确的任务列出来。注意是「任务」不是「部门」——不是「财务部」,而是「发票核验」「回款对账」「异常报销识别」。颗粒度要到「能拿样本测试」为止。

第二步:抽样实测。 每个任务取 20-50 个真实样本,直接用你能拿到的最强模型跑一遍,人工判定对错。Dean 说上下文工程「只需要一个 API」,盘点也一样——不需要任何工程投入,一个下午就能测完一批任务。这一步的关键是 用真实样本:拿你真实的发票、真实的客户咨询、真实的工单,而不是造几个「典型例子」。

第三步:三区分类。 按成功率把任务扔进三个区:

区域模型成功率含义动作
机会区0-1%模型拿不到或没见过若数据在你手里,值得自建
危险区20% 上下能力已在模型里萌芽不要自建,会被下个版本吃掉
红海区80%+模型已经做得很好直接用现成的,别重复造
            你的任务清单
        每个任务抽 20-50 个真实样本
        用最强模型跑一遍,人工判对错
   ┌────────────┼────────────┐
   ▼            ▼            ▼
┌──────┐    ┌──────┐    ┌──────┐
│ 0-1% │    │ ~20% │    │ 80%+ │
│机会区│    │危险区│    │红海区│
└──┬───┘    └──┬───┘    └──┬───┘
   ▼           ▼           ▼
数据在你手里? 放弃自建     买现成的
   │          (会被吃掉)  (别造轮子)
是 → 值得做
否 → 再评估
# generated by hugo AI

第四步:判定持续性。 对机会区里的每个任务再问一句:这个 0% 是因为「拿不到」还是「没见过」?答案决定优先级——锁在你权限后面的数据造成的 0%,优先做。

两个诚实的说明。第一,分区边界不是刀切的:2% 到 15% 之间、30% 到 80% 之间是灰色地带,靠「模型进步速度 vs 你的数据壁垒厚度」来判断,拿不准就先放一放,下个盘点周期再看。第二,「一个下午测完」是乐观估计——适用于样本好取的任务;样本本身要清洗半天的,另算时间。但无论如何,这是整个 AI 立项流程里最便宜的一步。

测试本身不需要写工程代码,最小骨架就是:

def audit(task_samples: list[dict]) -> float:
    """task_samples: 20-50 个真实样本,每个含 input 和人工标准答案。"""
    hits = 0
    for s in task_samples:
        output = call_strongest_model(s["input"])
        if human_judge(s["expected"], output):  # 人工判定,别用模型自评
            hits += 1
    return hits / len(task_samples)
# generated by hugo AI

注意 human_judge——盘点阶段必须人工判对错。用模型给模型打分,你会得到一片虚假繁荣。

四、拿我们的会议纪要数字员工走一遍

用我们自己做会议纪要数字员工的经历验证一遍这套方法。

通用转写:拿真实会议录音测,开源 ASR 的转写成功率早就 80% 以上——红海区。事实也如此:转写能力已经是免费基础设施,自建纯属浪费。

生成纪要:大约落在危险区。模型能总结、能提炼,做得不算差——但这个能力正在被每一代基座模型快速吃掉。如果我们的价值只停在这里,产品寿命以模型版本计。

「小王跟进一下」里的「小王」是谁:成功率 0%。不是模型笨,是它的视野里没有通讯录;待办该派给谁,模型的视野里没有组织结构和项目分工。而通讯录、组织关系、项目归属,恰好全部锁在企业自己的系统里——典型的「拿不到」。

于是整个产品的价值结构一目了然:转写用现成的,摘要借基座模型,真正的差异化全部押在 0% 区——把通讯录、组织、项目上下文接进去。这个选择不是拍脑袋,是盘点出来的。完整的工程展开在 五个问题,判断一个岗位能不能交给数字员工数字员工背后的 Agent,是五层基础设施的叠加 里写过。

这也回答了开头那个「从哪开始」的问题:不是从「模型能做什么」开始,是从「我的哪些任务,模型因为拿不到我的数据而做不了」开始。

写在最后

盘点四步法,一个下午能跑完第一遍。它不会告诉你 AI 的全部答案,但会帮你避开企业 AI 最常见的两种死法:把钱花在红海区重复造轮子,把希望寄托在危险区等模型厂商不收编。

模型的每一次升级,都会重新划定三个区的边界——所以盘点不是做一次,是每半年做一次。这本身也是一种上下文竞争:谁更早看清自己组织里哪些 0% 是持续的,谁就先拿到那块模型的光永远照不到的地方。

你的公司里,盘出过哪些 0% 的任务?欢迎留言聊聊。


See also