一切皆插件的时代,唯一不可插件化的是信任

In an Age of Pluggable Everything, Trust Is the One Thing You Can't Plugin

前两天,一个问题把我问住了。

有人问我:DeepSeek 说「一切皆插件」,一切核心都可以替换——模型可换、循环可换、连会话日志都是插件。那么,什么东西是不可替换的? 是不是只有人和人的协作?再往深一层,是不是「信任」不可替换?

我盯着这个问题想了很久,因为它恰好戳中了我这两天写 一切皆插件:DeepSeek Harness 真正硬核的是三个细节 时一直绕不开的东西。

一切皆插件——注册即副作用,卸载即回滚。整个系统的设计哲学只有一句话:没有什么是不能拿掉的。

但真的什么都可以拿掉吗?

答案是否定的。有一样东西,不管架构怎么解耦、日志怎么追加、插件怎么热插拔,它既不能被替换,也不能被快速恢复。

那就是信任。

In an Age of Pluggable Everything, Trust Is the One Thing You Can’t Plugin

[Read More]

AI 重构行业的速度,是可以算出来的

The Speed of AI Disruption Is Computable

上周有两个消息放在一起看,特别有意思。

一条是:AI 客服已经能独立处理大部分标准咨询,有的团队把人工坐席砍了一半以上。另一条是:AI 医生还在辅助写病历的阶段,离独立诊断隔着十万八千里。

同一种技术,同一个十年,为什么差出这么多?很多人的答案是「医疗数据难搞」「监管严」——都对,但都只是现象。现象背后有一个可以算的东西: AI 重构一个行业的速度,是有公式的。 这个公式不仅能解释客服和医疗的差距,还能告诉你自己的行业排在队里的第几个。

The Speed of AI Disruption Is Computable

[Read More]

一切皆插件:DeepSeek Harness 的野心与收敛鸿沟

Everything Is a Plugin: DeepSeek Harness and the Convergence Gap

昨晚刷到一篇实测文,作者用 DeepSeek Harness 做了一个叫 MacDynamicIsland 的原生 macOS 应用——刘海、菜单栏、悬浮胶囊三个入口,快捷笔记、剪贴板、截图置顶全都有。时间线是这样的:

  • 2 小时:从零到大部分功能可运行
  • 1 小时:改一个文本框的交互和字体颜色,反复修改,始终没有收敛——修好一处,另一处又坏了
  • 30 分钟:把同一份代码交给 Codex,文本框、字体颜色、交互优化基本收敛到可接受状态

作者很克制,特意声明这不是一次公平对比——Codex 接手时已经有了完整的项目基础,问题边界也被前面的试错磨清楚了。我认同这个声明。但这条时间线里藏着一个比「谁更强」重要得多的信号:从 0 到 1 只花了 2 小时,从 1 到 1.1 却花了 1 小时还没做完。

而 DeepSeek 对这件事的态度,就写在它刚开源的 Harness 里。

Everything Is a Plugin: DeepSeek Harness and the Convergence Gap

[Read More]

Agent 为什么在第 30 步翻车

Long-Horizon Agents Fail When They Leave the Light

上周一个做 Agent 集成的工程师来问我:「我的 Agent 前十步表现很好——读文档、列计划、写代码,都很干净。但到第 30 步左右就开始胡来:调错 API,覆盖自己刚改过的文件,甚至重复执行已经做完的操作。我是不是该换个更强的模型?」

我问他:每次都栽在同一个地方吗?他想了想说,不是,但跑得越远越不稳。

我说,那多半不是模型的问题。 它是走出了灯光照亮的地方。

无独有偶,今年 YC Startup School 上,主持人 Diana Hu 向 Jeff Dean 提了几乎一模一样的问题:「Agent 在前 10 步都很棒,到第 50 步就开始晃了。你觉得今天的瓶颈是什么?」Dean 的回答,是我见过对这个现象最准确的解释。

Long-Horizon Agents Fail When They Leave the Light

[Read More]

数字员工背后的 Agent,是五层基础设施的叠加

The Agent Behind a Digital Employee Is a Five-Layer Stack

上周整理数字员工的术语,有人在讨论里问了一个问题:

「数字员工背后的 Agent,具体实现上是一套什么东西?」

这个问题问得好。市面上大多数回答是这样的:一个模型加一段 Prompt,接一个知识库,套一个对话框。听起来也没错——demo 确实就是这么做出来的。

但 demo 和员工是两回事。我们做会议纪要数字员工的时候,第一版正是「模型 + Prompt + 转写」,能跑,但没人敢用:纪要里全是「小王跟进一下」,没人知道是哪个小王;待办派错了人,也没有任何机制能发现。

后来它变成一个真正能干活的数字员工,靠的不是换更强的模型——模型一直没换。靠的是在模型外面,一层一层搭起来的东西。

[Read More]

模型正在吞噬 Agent 框架

Models Are Eating Agent Frameworks — Thin the Layer or Pay the Debt

昨晚十一点半,我盯着自己那个钉钉数字员工项目里的一段代码发呆。

那是 core 模块里的轮询逻辑——每隔 3 秒去 serve 端拉一次会话状态,判断任务是否完成、是否超时、是否需要 abort。旁边是 session 管理:维护一个内存里的 Map,记录每个会话的生命周期、重试计数、上下文快照。再往下是 abort 清理:当用户取消任务时,要优雅地终止正在执行的工具调用、回收资源、把中间状态写回。

加起来大概 200 行。写得挺漂亮,有状态机、有超时退避、有异常兜底。我三个月前写它的时候,serve 端还没有原生的会话生命周期管理,没有 SSE 事件流推送,没有内置的 abort 语义。这 200 行是当时唯一的选择。

但昨晚我突然意识到: 这些代码的保质期,可能只剩一年。

不是因为它们写错了,而是因为它们正在被模型和运行时从两端同时吞噬。

[Read More]

模型与 Agent 的边界正在消失,但企业会选择看不见的那条线

When Models Swallow Agents, Data Sovereignty Draws the Line

上个月和一个做制造业的客户聊。他们花了三个月,把内部的工艺参数、良率数据、供应商评分全部结构化,喂给了一个通用模型的 RAG 系统。效果确实好——Agent 回答的工艺问题比他们自己工程师还准,内部试用两周,业务部门已经开始依赖了。

然后 CTO 问了我一个问题:「如果我的竞品也买了同一个模型的 API,我的这些知识会不会变成模型的一部分,间接服务于他?」

我沉默了几秒。不是技术上做不到隔离——模型厂商的合同里确实写着不训练、不留存。但我没法告诉他怎么 验证 这一点。这是一个 信任问题,不是技术问题

这个问题让我意识到:关于「模型和 Agent 的边界」的讨论,我们一直只从技术视角切入。但实际上,决定这条边界的不是能力,而是 数据主权

[Read More]

用 LLM 构建程序化知识系统:记忆、技能与进化

从静态 Prompt 到持续生长的数字大脑

上周我让 AI Agent 帮我写博客。它干得不错——风格、结构、代码规范都对。因为我之前花了一个下午,让它读完我的 174 篇旧文,把写作风格提炼成了一份可执行的 Skill 文件。

第二天我让它再写一篇,它又对了。第三天,还是对的。到第四天,我发现了一件有意思的事:它自己改了 Skill 文件。它在"反模式"列表里新增了一条——“不要用’随着 AI 的发展’开头”——这是前几次我手动纠正过的,但我从来没有明确要求它把这个规则写进去。

那一刻我意识到,这个 Agent 已经不是在"执行指令"了。它在积累经验

但紧接着我遇到了下一个问题:它记住了"怎么写文章",却不记得"上次写了什么"。我让它写一篇关于 Agent 进化的文章,它洋洋洒洒写了 800 行——和三天前那篇重复了 60%。技能在进化,记忆在归零,知识没有沉淀。三条腿,只长了一条。

这个经历让我重新审视了一个问题:我们到底需要怎样的知识架构,才能让 Agent 真正"越用越强"?不是靠更大的上下文窗口,不是靠更贵的模型,而是一套程序化的记忆、知识与技能管理系统

Karpathy 和社区最近的两个项目——让 Agent 一晚自主迭代 100 次实验的 autoresearch,和把任意文件夹变成可查询知识图谱的 graphify(25k+ stars)——也在指向同一个方向。

[Read More]

让 AI 自己写 Skill:可进化 Agent 的设计原理与最佳实践

Why procedural memory beats static prompts, and how to build skills that improve over time.

今天下午我做了一件听起来有点奇怪的事——让 AI 读完了我自己的 174 篇博客,提炼出写作风格,写成了一份可执行的配置文件,然后告诉它:“以后每次写文章就按这个标准来,写完还要自己更新它。”

它真的照做了。不仅生成了一份包含六大风格特征、两种文章模板、四个薄弱环节和改进路线图的 Skill 文档,还自动附加了一条"进化协议"——每次使用完毕后检查是否需要更新。

这不是 prompt engineering,也不是 RAG。这是给 Agent 建程序性记忆(Procedural Memory)。

很多人给 AI 配了知识库、写了几百行 system prompt,但用起来总觉得"不长进"。问题不在于模型,而在于记忆的结构。静态 prompt 是一次性指令,而可进化的 Skill 是活的——它会随着使用自动迭代、越用越准、越用越像你自己。

[Read More]