所以开始我的提问,其实是第一时间想到的可能性最高的几种可能。限制就是一上来就把范围框小了,真实情况是这七八层各自都能出岔,最后叠在一起,就成了 100 和 200 的差。然后就是我追问朋友的那句:怎么复核?老实说,我自己目前也只能想到最笨的那个办法,人工(没辙了这是)。把它数出来的东西,一条条拿回去核,和你自己手动数的对一遍;同一份输入跑两遍、数字对不上的,更得盯着看。我还没找到一个又省事又靠得住的自动复核法,想让AI替你把这几层都盯住,那还不如自己来呢。你要是有比人工复核更靠谱的路子,真的可以在留言里告诉我,我想看看别人是怎么解的。参考资料[1]: Thinking Machines Lab,“Defeating Nondeterminism in LLM Inference”,2025-09-10,https://thinkingmachines.ai/blog/defeating-nondeterminism-in-llm-inference/[2]: Tairan Fu 等,“Why Do Large Language Models (LLMs) Struggle to Count Letters?”,arXiv,2024-12,https://arxiv.org/abs/2412.18626