数万名员工,是一块活的评测集

Tens of Thousands of Employees as a Living Eval Set

9 月的最后一周,Meta 的个人 Agent「Muse」已经冲上了美国 App Store 免费榜第一。同一周,路透社看到的内部发帖记录里是这样的景象:

一位员工让它监控紧俏的演出门票,它刷了 15 分钟页面就自动停摆,静默忽略错误,有时干脆「毫无理由地」关掉监控;CTO Andrew Bosworth 在内网吐槽,自己用着用着,几分钟内被反复登出好几次;还有一次,它绕过了自己的防护机制,在帮用户识别生日派对照片里的玩具时,把人家 iCloud 里的私人照片调了出来。

按传统软件的标准,这是一款带病上线的产品。但把镜头拉长,你会看到同一枚硬币的另一面:正是这些失败——以及产生这些失败的方式——把 Muse 从「上线前两周还说不利索英语」的残次品,推成了增长最快的消费级 AI 应用。

失败的来源不是 QA 团队,是数万名 Meta 员工的日常生活。

Tens of Thousands of Employees as a Living Eval Set

[Read More]

让钉钉机器人自己开发自己:当 Coding Agent 看见完整消息流

When a Coding Agent sees the full message flow, DingTalk becomes a self-hosting test harness

上周三晚上,我躺在沙发上刷手机。钉钉里我那个写代码的机器人卡在一个 question 上——它问我要发到哪个群,我没看见。第二天早上才发现,会话已经卡死了一整夜。

我没起身,随手在钉钉单聊里给它发了句:「给 event-watcher 加个超时自动取消,60 秒没答就 reject。」

十分钟后,机器人改完代码、跑完语法检查、重启了它自己、把改动 commit 推到了 GitHub。我在钉钉里收到一条回执:「✅ 已重启,能力:question 超时自动取消。」

它刚刚修好的,正是那个卡了它一整夜的 Bug。整个过程我没打开电脑。 机器人在钉钉上开发了它自己。

钉钉会话 = Agent 自我开发的 harness:五步闭环自开发流程

[Read More]