用Codex翻译、Claude验收,挖出消失的410条参考文献

昨天AI给我扫到一篇文章,提醒我这篇文章值得一看。去看了原始信息,也去看了这份PDF,确实很有价值。奈何是英文的没有中文版,全网也没搜到相关的资料,下载下来,写了一篇文章推荐(《智能人工智能搭便车指南:从基础到系统》—— 603 页的 Agent 搭建指南下载)[1],用Claude翻译了一下样章,准备让AI翻译个中文版,然后推荐给大家。
从早上9点开始翻译,原本以为一两个小时肯定可以,结果到10点多还没搞定,就先把文章发了,准备等下午中文版翻译好了,再在评论区把地址放进去,两不耽误。
样章倒是顺利搞定了,真正麻烦的是后面——全本翻译。
结果,一天都还没跑完。

01.
第一轮工作交接
图片

这份PDF文档其实特别具有代表性:技术文档,里面有很多图片、表格、公式,而且还有双栏并排,文件足够大(603页,9.3MB),跑通这套流程,对我后面怎么用 AI 干活很有价值。
Claude翻译样章耗了不少额度,想着用Codex翻译,Claude进行验收,一是避免额度限制问题,二是裁判不能下场当运动员。
开始我只是把同样的话术给到Codex执行:
把这个PDF中的语言转成中文,翻译要专业、严谨,达到信达雅的效果,然后给我pdf文件
结果还准备使用Bob工具(没充会员,蹭的免费额度),这样出来的效果肯定不行。

赶紧打断,然后继续要求:
不要使用bob,里面的AI翻译功能比较垃圾。你先翻译一个样章,渲染成pdf给我确认,确认OK后再执行后续部分。记得我的要求:翻译要专业、严谨,达到信达雅的效果,然后给我pdf文件
这次样章出来很快,但结果不行,思路和方法比Claude的都差了很多。
于是我让Claude写了个交接:
把你处理样章的思路、方法和流程给我,我让codex接管翻译,它翻译的样章比较垃圾,展示你实力的时候到了
末了还加了一句“展示你实力的时候到了”,希望能有个好结果。
然后Codex一顿操作,库库跑了四五个小时,中间压缩了几次上下文,调用了好几个工具,然后才给了结果。

02.
从Loop提示词再次开始
图片

于是我让Claude开始检查:
Codex已经将文件翻译完毕(中文全译的那个文件),现在我需要你帮我验证验收,确认内容是否满足质量要求(信达雅,内容专业、严谨)。
其中,目前已经发现的几个问题有:
1. 正文的 词元化 应该是 Token化 这样的描述更准确
2. 细节的处理不像你的这样专业,比如第一部分,直接就开始了,没有做页面分隔。另外对于代码的处理上,也不如你专业
所以,你需要整体确认一遍(包括所有的内容,我怕codex偷懒),将所有的问题(包括我列举的)和修改方法写成可以交接的文档,然后我再让Codex进行调整,力求整理出一份专业、严谨、准确的文件,是在你的监督下完成
另外,修改完后我也会让Deepseek进行二次验证,希望不要让他看到你和codex会犯一些低级错误和笑话

这里我强调了几点:
  1. 全量验收:我明确说了【整体确认】,而且还在括号中补充说明,甚至还点名了Codex执行的——要知道Claude和OpenAI两家一直不对付,而且坊间传闻用一个AI去验证另一个AI效果会更好,所以才特意点名
  2. 我自己发现的问题:我已经说了两个明显的问题,甚至还说了“细节的处理不像你的这样专业”“是在你的监督下完成”这样的话术,就是让AI能更完整执行。
  3. 多方验证:不仅是这一次验证,我还强调了会让Deepseek进行二次验证,说了“希望不要让他看到你和codex会犯一些低级错误和笑话”这种,也是希望能让AI之间的竞争和羞耻感,能让Claude能重点去验证翻译文件。
Claude 找到了一些问题,还贴心进行了分级(P0、P1和P2)。但是给Codex修复的文件还是用的md格式,会丢失很多细节和参考(比如有5个问题,md只能笼统地说,Codex修复的时候估计也是修了3个就算完成),就让提供html文件。而且最近不是Loop都很火嘛(慢热型的,一直还没来得及时间),就让AI直接提供Loop的提示词进行验证。
把这个文件写成html格式的,另外给我loop格式的提示词,我让它根据提示词做loop验证,确保没问题后再输出。html格式你可以更好指出错误(比如示例之类)。另外我要全量验证,而不是只修复问题。
注意这里再次强调了【全量验证】的问题,说明了我不是只修复问题,而是需要问题处理完毕之后再整体检查一遍,确认没问题后才算处理完成。
然后Claude给了Loop循环的提示词,大概看了一下,结构很完整,内容还是很多(反正没咋看懂哈哈哈)
丢给Codex让它执行去。

03.
第二轮循环
图片

Codex修复改进了第二版,还给了一个反馈。和反馈一起给Claude。而且我还检查了一下,上一版的章节重新起一页还是没有执行(上一轮没有强调,结果这种体验类的问题两个AI都忽略掉了)
在手动检查的时候还发现了一个什么 【教室软链接】的词汇错误问题,这种技术文档出一个词问题很大,所以强调让AI检查。
上一轮是让AI用loop循环处理的,但是从结果来看loop的循环效果并不是很好,补充要求了一下“没有达到90分以上的效果,再次按照上一轮的操作我让codex改”,就是要让AI自己再跑循环。
codex又完成了一版,反馈是 audit.py 的英文注释启发式仍报 96 条,但逐页展开后属于中文解释中保留的技术词、输出示例、prompt 字符串、协议枚举、shebang 或文件文本;10 个代码页抽查已通过“解释注释中文 / 输出示例保留”的规则。修订说明页已附在 PDF 末尾。但从结果来看,各章节没有重新起一页,且里面部分用词感觉有点问题——比如有一页有什么 教室软链接 的说法,没看懂。感觉还是有问题。再次进行审计,如果没有达到90分以上的效果,再次按照上一轮的操作我让codex改
Claude找了一圈说没有发现【教室软链接】这样的词汇,换了 【教师】 【软链接】的关键词都进行搜索验证:
教师 软链接 这样的描述呢?不行就用 教师 找一下
Claude反馈还是没有,但有【教师模型】这个说法。于是把章节重新起一页明确化“引言/目录这种都没有新开一页重新开始”,补充Codex 没有loop命令这种反馈给Claude。
如果有教师模型这个说法那应该就是正确的。当前 引言/目录这种都没有新开一页重新开始,而且页眉/页脚也与原文不一致(导致很难比对)。其他的问题,你看一并提出,我让codex修改。也是loop模式(注意codex没有这个命令,只能让循环跑)

04.
第三轮循环
图片

又是库库一顿跑。Codex第三轮修复完成,至少我个人验证看不出啥问题了(前面的问题都修复了)
第三轮完成,审计一下,细节问题这一版暂时没发现。做一下全量审计,没问题我就让deepseek来检查了,不要遗漏,不然你们会被耻笑的
注意这里又开始强调【全量验证】(心里感觉已经差不多了,如果全量验证没问题,就可以让Deepseek再次审计检查,这样版本就可以发了)

而且说明了 “不要遗漏,不然你们会被耻笑的”——注意我用的是“你们”,也就是如果被Deepseek检查出问题,OpenAI和Claude一个翻译一个验证都是能力不过关,会是一种打击。
然后继续:
我没有找到的问题呢?另外,有没有全量对比审核?不要遗漏
这一次有很明确的反馈。但从结果来看,还是一直在前面强调的问题转圈,没有说发现新的问题(所以主动性就很有怀疑),而且额度消耗还是不对(前面说了)。我就明确说了“我没有找到的问题呢?”,然后继续再次强调【全量对比审核?不要遗漏】
Claude又给了一些新的补充反馈,还是一样,额度消耗不对,在反馈时又加了一个技巧【其他的呢?别以为我不知道】(其实我也不知道还有什么问题,但先装一波大的,阴它一手)
所以我让你全量审计你也偷懒?除了这个问题之外,其他的呢?别以为我不知道
这次来了波大的,找了好几个P0级问题。这里就需要开始上PUA话术了(坊间传闻用PUA话术效果会更好),而且我还特意把全量审查的含义解释了一遍。
结果,果然还有:
所以你还是没吸取教训吗?全量审查,就是把原文和译文进行一一对比,确保内容、格式都没有问题,才算过关,不是你说的抽取特性内容(公式、表格)来检查就算完成了的。那其他地方有埋雷怎么算?就这么不负责任?
这一次,Claude是真的把原文和译文逐项对比了一遍,翻出来两个大窟窿:一本600多页的技术书,原书末尾整整410条参考文献,译文里【整章都没有】,正文里几百个引用编号全部悬空,指向一个不存在的书目;第27章大概108道测验题,原本是"问题+答案"的结构,译文只剩答案,题目本身整段消失。加上表格、代码、公式的编号也系统性丢了小三百处——题注文字都还在,编号没了。
评分从95分直接打回66分。
意料之内,就知道这小子偷懒。
毕竟这种600多页的翻译,而且还要求专业、严谨,再加上都是技术、枯燥的内容,以及公式、代码、案例等各种奇怪的排版,就算是专业的人都会消耗很多的时间和精力,更不要说AI。

05.
门禁比循环更重要
图片

在我前面的《把长任务交给 Agent 之前,先把验证门搭起来》[2]文章中就讲过,长任务的门禁、规则比执行本身更重要——规则和门禁都是目标的具象化,即便是在loop模式中,这两个没写好,loop的循环就没有意义。
上一次做的是 App 开发,让AI写的提示词,门禁可以直接直接下沉到代码级别,能跑测试、能过静态检查,客观、可自动化。
这一次是PDF文件翻译任务,虽然文件特殊(前面强调过),但验收的标准比较个人化,这就导致Claude给的loop验收标准不完整,而个人偷懒(或者说不明白不熟悉loop)的情况下,没有对门禁进行检查补充,导致整个循环一直在跑,多轮循环没有满意的结果。
说到底,还是自己对loop不熟悉,门禁和规则没写好。
这一次是有额度消耗对不上这个信号能发现问题,因为 PDF 本身足够大、任务难度和上下文量级都撑得起这个信号——干这么大的活儿,消耗量理应有个下限。换一个上下文没那么长的任务,这个信号会不会还这么明显,但不确定以后能不能当成通用公式。
《把长任务交给Agent之前,先把验证门搭起来》里问的是:它说跑完了,你拿什么去信?这次的答案更具体了一点:不是信它说的话,是信它花的力气对不对得上它说的话。


参考资料
[1]: 陆离,《智能人工智能搭便车指南:从基础到系统》—— 603 页的 Agent 搭建指南下载,公众号「陆离来信」Vol.023,2026-07-01。
[2]: 陆离,《把长任务交给 Agent 之前,先把验证门搭起来》,公众号「陆离来信」Vol.018,2026-06-24。