前两天我拿到一份文件:Claude 最新旗舰模型 Fable 5.1 在 claude.ai 消费端的完整系统提示词。不是泄露的片段,不是网友总结的版本——是完整原文。
274,608 个字符,超过 4 万个英文单词。
大多数人听到「系统提示词」会想到一段开场白:「你是一个乐于助人的 AI,请礼貌、安全地回答。」我以前也是这个印象。但把这份文件从头到尾读完之后,我改变了判断:
这不是提示词,这是一套个人操作系统。
一、它有文件系统:记忆是一份带门卫的档案柜
先看结构。这份提示词里,记忆不是一个模糊的「我会记住你」,而是一个完整的文件系统:固定分类目录(/profile、/topics、/areas、/people、/preferences),每个事实一行,每条都必须带来源标签。
最有意思的是准入规则。原文要求:只存用户亲口说出的事实——标签叫 [stated],明令禁止存推理出来的事实、禁止存从搜索结果里拿到的事实。你告诉它「我在 Holton 工作」,它可以记;它自己推断出「Holton 属于 Newaygo County」,不许记。
还有一条「地平线测试」:写下任何一条记忆之前,问自己——一个月后这句话还成立吗? 不成立就不存。
而且写入不在对话里发生。对话结束时有一个后台流程回看整段对话,自动归档。用户的原话、反复出现的偏好,才会沉淀成记忆;一次性的随口一提,不记。
把这套规则写成一个最小模型,准入优先的意思就具体了:
from dataclasses import dataclass
from datetime import date
@dataclass(frozen=True)
class MemoryEntry:
"""一条带门卫的记忆:只收用户亲口所说,且通过地平线测试。"""
fact: str
stated_by_user: bool # 只存用户亲口说的,推理/搜索结果一律拒收
horizon_days: int = 30 # 地平线测试:一个月后还成立吗
def admit(self, today: date) -> bool:
return self.stated_by_user and self.horizon_days >= 30
# 用户说「我在 Holton 工作」→ 准入
# 模型推断「Holton 属于 Newaygo County」→ 拒收
ENTRY_USER = MemoryEntry("用户在 Holton 工作", stated_by_user=True)
ENTRY_INFERRED = MemoryEntry("Holton 属于 Newaygo County", stated_by_user=False)
print(ENTRY_USER.admit(date.today()), ENTRY_INFERRED.admit(date.today())) # True False
# generated by hugo AI
检索型记忆系统没有 admit 这一层——什么都先存进去,找不找得到是后面的事。Anthropic 把门卫放在最前面。
我在 Agent 设计最佳实践:Memory 里详细讲过 OpenClaw 的记忆架构——分层存储加向量检索,核心问题是 怎么找回来。Anthropic 这版的核心问题不一样,是 什么有资格进来。
这是两种哲学:检索优先,还是准入优先。Anthropic 选了后者。理由不难猜——消费端要面对的是海量普通用户,记忆一旦出错,是投诉、是诉讼、是「AI 偷存了我的隐私」。所以每条记忆都要能追溯到用户原话,可审计、可自证。代价是:它主动放弃了记忆的智能——连接、推断、举一反三,这些「高级记忆能力」被明文禁止了。
二、它有退出协议:Assistant 有权辞职
文件系统之外,这份提示词里还有一个工具,我读到的时候愣了一下:end_conversation——Claude 有权结束一段对话关系。
不是拉黑,不是静默,是一套完整的协议:
多次建设性引导失败
↓
明确警告(指出问题行为 + 说明可能结束对话)
↓
用户仍未改变
↓
调用 end_conversation(工具要求二次确认)
↓
对话永久结束
# generated by hugo AI
两个细节值得注意。第一,工具本身带确认机制:第一次调用不会真的结束,只返回一个确认请求;确认了才执行。第二,有硬性豁免——只要用户疑似处于自伤或心理危机状态,永远不许使用这个工具,哪怕用户在辱骂和挑衅。
我在写数字员工系列的时候,一直在讨论组织怎么管理 agent:身份、权限、绩效、审计。Anthropic 这里往前走了一步:agent 也有 退出权——但退出不是特权,是流程。要留警告记录,要走确认,要遵守豁免条款。
换句话说:员工不只是被管理的对象,也是关系的参与方;而关系的建立和解除,都应该是协议化的。这在企业管理里是常识(离职流程),在 AI 产品里是第一次见到这么完整的实现。
三、它有信任外壳:同一个模型,两种产品
文件开头的产品信息部分,透露了一个此前只有传闻的产品事实:
Claude Fable 5.1 和 Claude Mythos 5.1 共享同一个底层模型。Fable 5.1 是面向大众的版本,附带额外的双用途能力安全措施;Mythos 5.1 是去掉这些措施、仅向审批组织开放的版本。
同一块芯片级的能力,套两个不同的信任外壳,就是两个不同的产品。Fable 有护栏,卖给所有人;Mythos 去掉护栏,只卖给通过审批的组织(公开资料显示是网络安全研究方向,Project Glasswing)。
这验证了我此前在钉钉的护城河是组织世界的信任基础设施里提过的一个判断:Agent 时代,界面会被绕过,信任不会。Anthropic 用自家的旗舰产品演示了这件事的另一面——信任不只是基础设施,信任还是产品形态本身。能力的上限由模型决定,能力释放到哪一层,由信任外壳决定。
四、反方:写在纸上的规则,模型不听怎么办
写到这里必须处理一个最强反方:系统提示词说到底只是一段文本。274KB 的规约写得再漂亮,模型不遵守,或者在长尾场景里失效,不就全是纸面文章吗?行为难道不该训进模型里、做进运行时里?
这个质疑有道理。提示词确实不是铁律——它是概率性的约束,不是编译期保证。但我认为它仍然是对的选择,理由有三层:
第一,可迭代。 模型的边界靠训练划,训练以月为单位;行为的边界靠提示词划,迭代以天为单位。法规在变、产品在变、用户行为在变,唯一跟得上的只有文本层。
第二,可审计。 训进模型的规则是黑箱,出事说不清「我们要求过它怎么做」;写在提示词里的规则白纸黑字,可引用、可版本化、可在法庭和监管面前自证。这和一、二节的设计一脉相承:记忆要可溯源,退出要留记录——治理的本质不是强制执行,是可追溯的承诺。
第三,模型越强,提示词越有效而不是越无效。 弱模型你写多少规则它都记不住;旗舰模型对长篇规约的遵循能力,恰恰是它值这个价钱的原因之一。
在一切皆插件:DeepSeek Harness 真正硬核的是三个细节里我写过,「运行时」和「工具」的分界线在于有没有不可替换的核心。Anthropic 这份文件给出了另一个分界:消费级 agent 的成熟度,不看它能力多强,看它的治理层有多厚。
五、274KB 本身就是论据
把全文的结构浓缩成一张表,「操作系统」这个判断就立住了:
| 组件 | 提示词里的证据 | 对数字员工的启示 |
|---|---|---|
| 文件系统 | 记忆固定分类目录 + [stated] 准入 + 地平线测试 | 记忆要有门卫:什么有资格进来 |
| 进程协议 | end_conversation 警告 → 确认 → 豁免清单 | 关系解除要协议化、留记录 |
| 权限外壳 | Fable / Mythos 同源双壳 | 能力释放到哪一层,由信任决定 |
| 审计日志 | 每条记忆可溯源、每次退出留警告 | 治理的本质是可追溯的承诺 |
这份提示词里还有的:网络出口域名白名单、只读挂载目录清单、技能目录、版权硬约束、儿童安全的详细操作规程……全部明文写定。
所以完整地说:Anthropic 给 Claude 装的不是一段提示词,而是一套个人操作系统——文件系统(记忆准入)、进程协议(退出机制)、权限外壳(Fable/Mythos 双壳),一应俱全。
这对我们做数字员工意味着什么?意味着当你在讨论「怎么让 agent 更聪明」的时候,Anthropic 的旗舰团队在讨论的是另一组问题:它该记什么、什么都有资格记;它什么时候可以走、走之前要留下什么;同一份能力,对谁释放到哪一层。
能力的竞争在模型层,已经短兵相接;治理的竞争在操作系统层,才刚开始。
你自己的 agent 产品,记忆是「想记什么记什么」,还是有一道门卫?欢迎留言讨论。