同一个 skill,我统计 100,同事统计 200,是模型还是工具的问题?

岔子藏在你看不见的那摞层里

昨天一个朋友在群里说,他最近用 skill 总觉得哪儿不对劲。
一样的 skill,都是 AI 产品自带的,一样的数据标准和提示词,可提出来的数能差一半:同一批东西,他统计出 100 个问题,同事统计出 200 个。他现在拿这套东西做周报、做月报,做完常常不知道数字对不对。
我看到,回了一句:模型还是工具的问题?
他说不确定,前几天他们内部复盘过,觉得模型应该有影响,Python 有时候提取也会出问题。
图片 
我又追了一句:那怎么复核?
到今天还没回我。
昨天下午就在考虑这个问题,“模型还是工具”这个说法其实单一了。同一个 skill 到两个人手里差出一倍,能出问题的地方远不止模型和工具两处,是一整摞你平时根本不会去看的层(Herness环境)。我自己搭 skill 搭了挺久,手上用的都是自己一行行写的,所以这几层大概能从上往下数一遍。
最上面(也是最容易被拿来甩锅的)是模型。
这些 skill 背后是大模型,而大模型给你的数字,本质不是“数”出来的,是“猜”出来的。
有研究者拿一个大模型做过实验:同一个问题问1000遍,把随机性调到最低,连温度都设成 0,理论上该次次一样,结果收回来八十种不同的答案,最常见的那种也只出现了七十八次,更别说,它连数数本身都不在行[1]
有论文专门验过,模型能认出一个词里有哪些字母,但让它数有几个就开始错,要数的越多错得越离谱。你让它“统计有多少个问题”,它是在凭语感估一个数,不是真去点了一遍[2]
但你要就此认定“换个更强的模型就好”,那也不对,这个好像是当前模型共有的问题,不是换了就能搞定(具体原理因为不懂技术未知)
往下一层,是数据标准。
我朋友和他同事都觉得数据标准一样(提示词都一样)嘛。可 100 和 200 差的是一倍,这种成倍的差,不太像上面那种随机抖动(真随机顶多上下浮动一成),更像是两个人对“算一个问题”的理解根本不同:一个把一个大问题下面的三个子问题拆开数成三个,另一个按主题合并成一个。提示词里那句“统计问题数量”看着清楚,“一个”到底怎么算,其实是个糊的定义,模型每跑一次都替你把这个糊的地方填一遍,填法还不固定。“口径一样”,很多时候是个错觉。
再往下,才是真正拉开差距的那层:工具和配置。
我以前折腾另一个 AI 工具时就有过体会,同样是这一个东西,有人用得飞快,有人用得反复抽风,差别常常不在提示词,在配置和系统设计。同一个skill,用cursor执行和用codex执行,哪怕是同一个模型,也会有不小的差距。
可能还不止这三层,还会有其他因素:
  1. 原始数据不一样(不排除,毕竟都是朋友口述没在现场)
  2. 调用方式和上下文
  3. skill版本差异(可能性很小,毕竟都是团队作战会保证版本统一,但不排除)
所以开始我的提问,其实是第一时间想到的可能性最高的几种可能。限制就是一上来就把范围框小了,真实情况是这七八层各自都能出岔,最后叠在一起,就成了 100 和 200 的差。
然后就是我追问朋友的那句:怎么复核?
老实说,我自己目前也只能想到最笨的那个办法,人工(没辙了这是)
把它数出来的东西,一条条拿回去核,和你自己手动数的对一遍;同一份输入跑两遍、数字对不上的,更得盯着看。我还没找到一个又省事又靠得住的自动复核法,想让AI替你把这几层都盯住,那还不如自己来呢。
你要是有比人工复核更靠谱的路子,真的可以在留言里告诉我,我想看看别人是怎么解的。
参考资料
[1]: Thinking Machines Lab,“Defeating Nondeterminism in LLM Inference”,2025-09-10,https://thinkingmachines.ai/blog/defeating-nondeterminism-in-llm-inference/
[2]: Tairan Fu 等,“Why Do Large Language Models (LLMs) Struggle to Count Letters?”,arXiv,2024-12,https://arxiv.org/abs/2412.18626