定时任务 - Hugo Zhu's Blog

当 10 万个定时任务同时敲门：MaaS 平台调度优化实战

从整点风暴到分布式调度——平台视角的六个关键策略

Posted on April 3, 2026 | 7 min | 1473 words

上周五下午 3 点，告警群炸了：MaaS 层的 GPU 推理集群 QPS 在 60 秒内从 1200 飙到 18000，p99 延迟从 800ms 打到 45 秒，大量请求 429。

排查发现原因很"朴素"——大约 3 万个 OpenClaw 实例的定时任务都跑在整点。每个实例可能只有 1-3 个 cron job（数据摘要、定时巡检、报表生成），但所有人的 cron 都写着 0 * * * * 或 0 0 * * *。三万乘以三，就是整点瞬间涌来的近十万个 LLM 推理请求。

这不是应用层的 bug，而是平台设计的缺陷。当你的平台承载成千上万个租户的定时任务时，“整点风暴"不是意外——它是必然。问题是：作为平台设计者，你该怎么办？