把长任务交给 Agent 之前,先把验证门搭起来

先验,再放手

今年四月底,OpenAI 的 Codex 加了个 /goal 命令,十来天后 Claude Code 跟上,周一, xAI 的 Grok 也上了同一个东西[1]
你给 AI 一个目标,它自己规划、拆任务、一路往下跑到完成才停,网上已经有人晒无人值守跑十几个小时的记录。
METR 这家机构做了个指标叫"时间地平线":拿一件活,让人类专家做要花多久,再看 AI 能不能独立做完。GPT-2 那会儿是 2 秒,Claude 3.7 涨到 50 分钟,o3 差不多 2 小时,最新的 Opus 到了 12 小时上下,差不多每 7 个月翻一倍[2]
听上去,"放手让 AI 自己跑"的时代是真来了。
但有个细节,被各个媒体刻意忽略了没提:这个 12 小时,是 50% 成功率下的 12 小时。
说白了,跑这么长时间的任务,对一半、错一半。能跑多久的时间一直在涨,至于跑得对不对,是另一回事。
所以说,比"它能不能跑"更要紧的一个问题是:它说跑完了,你拿什么去信。

01.
两天就烂尾的项目
图片

前几个月AI圈里最热的词是Harness Engineering(套在大模型外面那层壳,让它能循环干活、能记事、出错能兜住)。流行的说法是:模型已经是大路货,外面那层壳才是护城河。
我信了。
当时 OpenClaw 的崩溃和稳定性正是个大问题。日常刷小红书、抖音上看到有人传,用钱老的《工程控制论》去调,据说效果很好。我也下了文件来看——可这种天阶功法,对我们这种小虾米就是天书。
看不懂,干脆让 Claude 读完替我配。
我定好目标,让它自己完成开发任务。它前后跑了一两个小时,跟我说开发完成了(搞了个维wen的定时任务系统),我就上线 OpenClaw 测试。第二天一看,不对:任务本身就有好几个报错,之后再没动静,Token 消耗还逆天(光这一摊,一天烧掉两百六十多万)
我赶紧停了任务。没想清楚之前,不再动它。
还有就是,每次像做网站、做 APP,都干到1/3就停工(感觉不是我想要的,或者说是跑偏了,没有初心)
当时我还天真地以为是自己不熟悉Harness Engineering,马鞍没搭好。最近才琢磨过味来:一个稳定的系统,根本不是外表看起来那么简单。哪怕是谷歌,一个搜索框背后也是无数工程师在支撑。

02.
我以为我有目标
图片

先说目标这头。
一直说"我知道自己要做什么"。可回头看,那不叫目标,叫愿望。"做个小程序""做一个定时任务跑起来"——这都不是目标。
真正的目标,得是一整套说清楚的东西:做一个什么类型的小程序,要哪些功能,做到什么效果,怎么样才算做成了。少了最后这一句,它就不是目标。
OpenAI 那份讲 Codex 长任务的白皮书里,有个对比说得很准[3]弱目标是"照这个文档把功能实现了";强目标是"把这个库迁移过去、保持接口兼容,拿它原来的单元测试当验收标准——跑过同一批测试、并说明差异,才算可以交"。
差别就在后半句:一个没法验,一个能验。
我当初喂给 AI 的,全是前一种。没有"怎么算做成"这把尺,它跑得再久,我也没法量。
更不要说还没解决的AI幻觉问题了:让它按我自己写的 skill 写文章,写出来一看不对,一问,它直接摊牌:自己随便写的,压根没按 skill 来。

03.
开两个对话干一件事
图片

看来还得要个监工才行,不能老是让自己人肉确认,毕竟自己也是半桶水。
于是我先让 AI 把目标和验收机制都写出来。然后开两个对话:一个只管开发,一个只管验收,上下文隔开。干活那个,没法自己给自己盖章说"做完了";验收那个,拿着写好的标准一条条对。
它偷不了懒、糊弄不过去;我自己不懂技术细节也不至于抓瞎——细节交给 AI 处理,验收这道门替我守着。
就一个小功能(我自己觉得),路上整了十几道质量关卡。
不是刻意拦路。而是我觉得,开发阶段 1% 的疏忽,到项目后期,就是时间和精力上的一个巨大浪费(千里之堤毁于蚁穴)。能在一开始就把这些问题摁住才要紧,而不是去纠结门多不多、烦不烦。
而且真正难的,从来不是定目标。大方向谁都好定,难的是目标背后那些规则和条件,所有的细节,全是恶心人的问题。没有一道道门把着,说不定哪天就炸雷。
当然,不是什么都得这么管。
尝试性的、拿来验证想法的,尽管让 AI 去跑,跑挂了也无所谓(反而希望问题多一些,幻觉多一些,能更好帮自己找到思路、验证想法);但要稳定、有风险的东西,还是得自己来,AI 打辅助。
所以再看这些把"验证"做进产品的功能——/goal 把"跑完"重新定义成"跑完并且验过",那个安全项目让 AI 去挖漏洞、但每条都得人确认了才放出去[4]——我一点不意外。
METR 那个数字还会接着涨,AI 能自己跑的活只会越来越长。
可越是这样,"它说做完了、你拿什么验"这道门,越省不掉。
所以这一次,没想清楚拿什么验它之前,我不会再把长活整个交出去。


参考资料
[1]: OpenAI Codex CLI v0.128.0 首发 /goal,2026-04-30,<https://developers.openai.com/codex/changelog>;Anthropic Claude Code v2.1.139 跟进 /goal,每轮以一个独立模型核验完成条件,2026-05-11,<https://code.claude.com/docs/en/goal>;xAI,《Introducing /goal》,2026-06-22,<https://x.ai/news/introducing-goal>。
[2]: METR,《Measuring AI Ability to Complete Long Tasks》,2025-03-19,<https://metr.org/blog/2025-03-19-measuring-ai-ability-to-complete-long-tasks/>;并见《Task-Completion Time Horizons of Frontier AI Models》,<https://metr.org/time-horizons/>;arXiv:2503.14499
[3]: OpenAI / Jason Liu,《Codex-maxxing for long-running work》(白皮书),2026-06-22,<https://openai.com/index/codex-maxxing-long-running-work>
[4]: OpenAI,《Patch the Planet: a Daybreak initiative to support open source maintainers》,2026-06-22,<https://openai.com/index/patch-the-planet/>
[5]: 陆离,《AI 最贵的智商税,是让你以为事情已经办成了》(陆离来信 Vol.016),2026-06-09。