用Codex翻译、Claude验收,挖出消失的410条参考文献
从早上9点开始翻译,原本以为一两个小时肯定可以,结果到10点多还没搞定,就先把文章发了,准备等下午中文版翻译好了,再在评论区把地址放进去,两不耽误。样章倒是顺利搞定了,真正麻烦的是后面——全本翻译。这份PDF文档其实特别具有代表性:技术文档,里面有很多图片、表格、公式,而且还有双栏并排,文件足够大(603页,9.3MB),跑通这套流程,对我后面怎么用 AI 干活很有价值。Claude翻译样章耗了不少额度,想着用Codex翻译,Claude进行验收,一是避免额度限制问题,二是裁判不能下场当运动员。把这个PDF中的语言转成中文,翻译要专业、严谨,达到信达雅的效果,然后给我pdf文件结果还准备使用Bob工具(没充会员,蹭的免费额度),这样出来的效果肯定不行。不要使用bob,里面的AI翻译功能比较垃圾。你先翻译一个样章,渲染成pdf给我确认,确认OK后再执行后续部分。记得我的要求:翻译要专业、严谨,达到信达雅的效果,然后给我pdf文件这次样章出来很快,但结果不行,思路和方法比Claude的都差了很多。把你处理样章的思路、方法和流程给我,我让codex接管翻译,它翻译的样章比较垃圾,展示你实力的时候到了末了还加了一句“展示你实力的时候到了”,希望能有个好结果。然后Codex一顿操作,库库跑了四五个小时,中间压缩了几次上下文,调用了好几个工具,然后才给了结果。Codex已经将文件翻译完毕(中文全译的那个文件),现在我需要你帮我验证验收,确认内容是否满足质量要求(信达雅,内容专业、严谨)。1. 正文的 词元化 应该是 Token化 这样的描述更准确2. 细节的处理不像你的这样专业,比如第一部分,直接就开始了,没有做页面分隔。另外对于代码的处理上,也不如你专业所以,你需要整体确认一遍(包括所有的内容,我怕codex偷懒),将所有的问题(包括我列举的)和修改方法写成可以交接的文档,然后我再让Codex进行调整,力求整理出一份专业、严谨、准确的文件,是在你的监督下完成另外,修改完后我也会让Deepseek进行二次验证,希望不要让他看到你和codex会犯一些低级错误和笑话- 全量验收:我明确说了【整体确认】,而且还在括号中补充说明,甚至还点名了Codex执行的——要知道Claude和OpenAI两家一直不对付,而且坊间传闻用一个AI去验证另一个AI效果会更好,所以才特意点名
- 我自己发现的问题:我已经说了两个明显的问题,甚至还说了“细节的处理不像你的这样专业”“是在你的监督下完成”这样的话术,就是让AI能更完整执行。
- 多方验证:不仅是这一次验证,我还强调了会让Deepseek进行二次验证,说了“希望不要让他看到你和codex会犯一些低级错误和笑话”这种,也是希望能让AI之间的竞争和羞耻感,能让Claude能重点去验证翻译文件。
Claude 找到了一些问题,还贴心进行了分级(P0、P1和P2)。但是给Codex修复的文件还是用的md格式,会丢失很多细节和参考(比如有5个问题,md只能笼统地说,Codex修复的时候估计也是修了3个就算完成),就让提供html文件。而且最近不是Loop都很火嘛(慢热型的,一直还没来得及时间),就让AI直接提供Loop的提示词进行验证。把这个文件写成html格式的,另外给我loop格式的提示词,我让它根据提示词做loop验证,确保没问题后再输出。html格式你可以更好指出错误(比如示例之类)。另外我要全量验证,而不是只修复问题。注意这里再次强调了【全量验证】的问题,说明了我不是只修复问题,而是需要问题处理完毕之后再整体检查一遍,确认没问题后才算处理完成。然后Claude给了Loop循环的提示词,大概看了一下,结构很完整,内容还是很多(反正没咋看懂哈哈哈)。Codex修复改进了第二版,还给了一个反馈。和反馈一起给Claude。而且我还检查了一下,上一版的章节重新起一页还是没有执行(上一轮没有强调,结果这种体验类的问题两个AI都忽略掉了)。在手动检查的时候还发现了一个什么 【教室软链接】的词汇错误问题,这种技术文档出一个词问题很大,所以强调让AI检查。上一轮是让AI用loop循环处理的,但是从结果来看loop的循环效果并不是很好,补充要求了一下“没有达到90分以上的效果,再次按照上一轮的操作我让codex改”,就是要让AI自己再跑循环。codex又完成了一版,反馈是 audit.py 的英文注释启发式仍报 96 条,但逐页展开后属于中文解释中保留的技术词、输出示例、prompt 字符串、协议枚举、shebang 或文件文本;10 个代码页抽查已通过“解释注释中文 / 输出示例保留”的规则。修订说明页已附在 PDF 末尾。但从结果来看,各章节没有重新起一页,且里面部分用词感觉有点问题——比如有一页有什么 教室软链接 的说法,没看懂。感觉还是有问题。再次进行审计,如果没有达到90分以上的效果,再次按照上一轮的操作我让codex改Claude找了一圈说没有发现【教室软链接】这样的词汇,换了 【教师】 【软链接】的关键词都进行搜索验证:教师 软链接 这样的描述呢?不行就用 教师 找一下Claude反馈还是没有,但有【教师模型】这个说法。于是把章节重新起一页明确化“引言/目录这种都没有新开一页重新开始”,补充Codex 没有loop命令这种反馈给Claude。如果有教师模型这个说法那应该就是正确的。当前 引言/目录这种都没有新开一页重新开始,而且页眉/页脚也与原文不一致(导致很难比对)。其他的问题,你看一并提出,我让codex修改。也是loop模式(注意codex没有这个命令,只能让循环跑)又是库库一顿跑。Codex第三轮修复完成,至少我个人验证看不出啥问题了(前面的问题都修复了)。第三轮完成,审计一下,细节问题这一版暂时没发现。做一下全量审计,没问题我就让deepseek来检查了,不要遗漏,不然你们会被耻笑的注意这里又开始强调【全量验证】(心里感觉已经差不多了,如果全量验证没问题,就可以让Deepseek再次审计检查,这样版本就可以发了)。而且说明了 “不要遗漏,不然你们会被耻笑的”——注意我用的是“你们”,也就是如果被Deepseek检查出问题,OpenAI和Claude一个翻译一个验证都是能力不过关,会是一种打击。我没有找到的问题呢?另外,有没有全量对比审核?不要遗漏这一次有很明确的反馈。但从结果来看,还是一直在前面强调的问题转圈,没有说发现新的问题(所以主动性就很有怀疑),而且额度消耗还是不对(前面说了)。我就明确说了“我没有找到的问题呢?”,然后继续再次强调【全量对比审核?不要遗漏】Claude又给了一些新的补充反馈,还是一样,额度消耗不对,在反馈时又加了一个技巧【其他的呢?别以为我不知道】(其实我也不知道还有什么问题,但先装一波大的,阴它一手)所以我让你全量审计你也偷懒?除了这个问题之外,其他的呢?别以为我不知道这次来了波大的,找了好几个P0级问题。这里就需要开始上PUA话术了(坊间传闻用PUA话术效果会更好),而且我还特意把全量审查的含义解释了一遍。所以你还是没吸取教训吗?全量审查,就是把原文和译文进行一一对比,确保内容、格式都没有问题,才算过关,不是你说的抽取特性内容(公式、表格)来检查就算完成了的。那其他地方有埋雷怎么算?就这么不负责任?这一次,Claude是真的把原文和译文逐项对比了一遍,翻出来两个大窟窿:一本600多页的技术书,原书末尾整整410条参考文献,译文里【整章都没有】,正文里几百个引用编号全部悬空,指向一个不存在的书目;第27章大概108道测验题,原本是"问题+答案"的结构,译文只剩答案,题目本身整段消失。加上表格、代码、公式的编号也系统性丢了小三百处——题注文字都还在,编号没了。毕竟这种600多页的翻译,而且还要求专业、严谨,再加上都是技术、枯燥的内容,以及公式、代码、案例等各种奇怪的排版,就算是专业的人都会消耗很多的时间和精力,更不要说AI。上一次做的是 App 开发,让AI写的提示词,门禁可以直接直接下沉到代码级别,能跑测试、能过静态检查,客观、可自动化。这一次是PDF文件翻译任务,虽然文件特殊(前面强调过),但验收的标准比较个人化,这就导致Claude给的loop验收标准不完整,而个人偷懒(或者说不明白不熟悉loop)的情况下,没有对门禁进行检查补充,导致整个循环一直在跑,多轮循环没有满意的结果。说到底,还是自己对loop不熟悉,门禁和规则没写好。这一次是有额度消耗对不上这个信号能发现问题,因为 PDF 本身足够大、任务难度和上下文量级都撑得起这个信号——干这么大的活儿,消耗量理应有个下限。换一个上下文没那么长的任务,这个信号会不会还这么明显,但不确定以后能不能当成通用公式。[1]: 陆离,《智能人工智能搭便车指南:从基础到系统》—— 603 页的 Agent 搭建指南下载,公众号「陆离来信」Vol.023,2026-07-01。[2]: 陆离,《把长任务交给 Agent 之前,先把验证门搭起来》,公众号「陆离来信」Vol.018,2026-06-24。