新模型又登顶了,但我只想问 AI 一件事:这活能干完吗?

跑分赢了不算赢,把任务做完才算

最近 AI 圈有点热闹过头了。
一个模型刚发布,大家先抢首发,然后看跑分,再和其他模型比较。这个超过那个,那个又超过另一个。国内平台也一样,模型一出来就开始测,测编程、测推理、测做网页,恨不得当天就把排行榜重新排一遍。
看多了会有一种感觉:模型之间的差距还在快速拉大,自己如果不赶紧换,就要落后了。
实际呢?
模型当然还在进步,也还会继续变强。只是对大多数日常任务来说,能力已经开始够用了。写文档、整理资料、处理表格、总结会议、做普通分析,甚至完成一些常见的开发工作,现在已经很少是“AI 完全不会”的状态。
问题是:AI能不能按要求做出来,有没有把事情做完(符合用户期望)


01.
AI 进入“能力够用”时代
图片

9 月 1 日,Anthropic 发布 Fable 5.1 和 Mythos 5.1。前者在 Artificial Analysis 的综合智能指数中以 66 分暂列第一。[1][2]
9 月 2 日,Google 又发布 Gemini 3.8 Flash,距离 3.7 Flash 只有三个星期,也是六周内第三次 Flash 更新。[3]
一个登顶,一组六周更新三代。看发布现场,模型之间的竞争还是谁更聪明、更快、更强大。
但回头看 AI 进入普通人工作的过程,问题已经变了。
ChatGPT 刚火起来的时候,能像个正常人一样接住各种问题,就已经足够让人惊喜了。再后来,就是尝试进入工作:写文章、写代码、写小红书。去年开始,风向逐渐变化,大家开始看它能不能理解复杂问题、做研究、处理长文档。
到现在,这条能力线基本上已经被跨过去了。
在写文档、整理资料、处理表格、总结会议、做普通分析这些日常任务里,主流模型的最低能力已经够用。按我目前的观察,最近几个月发布的主流模型更是如此。
这不是一个行业统计,也不是说某个模型已经能通吃所有任务。我想说的是,对日常任务来说,换一个跑分更高的模型,已经不能直接改变最后的结果。
但“能力够用”和“能力没有差距”是两回事。
模型厂商继续宣传自己的产品更聪明、更强大,这很正常。能力是最容易拿出来展示的东西,发布一张榜单,远比解释一个任务为什么少返工两次更直观。
但问题是:同一个模型,放到不同任务里,结论可能完全不一样。
有测试者用两章书、18 个模型跑了大约 60 次翻译,认为更便宜的 3.5 Flash Lite 反而排在 3.8 前面。[4] 另一项 3D 测试里,模型运行了 30 分钟、花了 2.30 美元,结果还是没有达到预期。[5]
翻译、3D、写代码、做研究,本来就不是同一件事。用一个任务的结果去证明某个模型整体更强或更差,本身就不太可靠(以偏概全)
如果只是写一份会议纪要、整理一批资料、改几段文字,或者把一个普通功能做出来,很多模型基本上都已经能做。这个时候,继续追“最强”,很可能只是把注意力放在了不那么重要的地方。
再沿着排行榜比下去,就真跑题了。


02.
用户的问题已经变了
图片

AI发展到现在,大家关注的问题其实变了几轮。
一开始关心的是 AI 有多聪明,后来开始关心 AI 能帮我做些什么,最近又逐渐转向 AI 能做多好。
AI 还停留在聊天框里的时候,模型本身几乎就是全部。你问它答,聪明不聪明,看回答就知道了。
但 AI 真正进入到我们的工作之后,场景就不一样了:AI要读取资料,理解上下文,调用工具,记住前面已经确认过的内容,有时候还要连续跑很多步。
这时候,模型本身只是其中一部分。
模型决定它会不会,上下文、记忆和执行环境决定它能不能在这次任务里把能力用出来。
它能不能理解当前任务,能不能记住你的限制条件,能不能拿到正确的资料,能不能在中间出错之后继续处理,或者发现路径不对时停下来,这些都会影响最终结果。
一个任务只要做到一半忘了前面的限制,工具没有真正执行,或者报错以后还沿着错误的路径继续跑,前面表现得再聪明,最后交出来的也只是半成品。
所以,大家开始谈 Agent、上下文、记忆系统和 Harness。说的还是几个很具体的问题:
  • AI 到底看到了什么?
  • 能不能记得前面说过的话?
  • 手里的工具能不能真的用?
  • 出了问题之后,是继续乱跑,还是换条路?
这些东西没有模型发布会上的跑分好看,但会直接影响使用体验。
同一个模型,放在不同的上下文、记忆和执行环境里,做出来的事情可能完全不是一个感觉。
以前只用聊天框的时候,一个回答看起来聪明,基本上就够了。现在把 AI 放进真实工作,一个答案、一次调用、一个生成出来的文件,都不能直接算完成。
这里说的“做完”,是要求没有漏,关键结果能够验证,经过必要检查以后可以直接进入下一步,而不是最后还要人从头接管一遍。

参考资料
[1]: Anthropic,《Introducing Claude Fable 5.1 and Claude Mythos 5.1》,Anthropic,2026-09-01,https://www.anthropic.com/claude-fable-and-mythos-5-1
[2]: Artificial Analysis,《Claude Fable 5.1 tops the Artificial Analysis Intelligence Index》,Artificial Analysis,2026-09-01,https://artificialanalysis.ai/articles/claude-fable-5-1
[3]: Google,《Introducing Gemini 3.8 Flash and Gemini 3.8 Flash Cyber》,Google,2026-09-02,https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/
[4]: @matgrimm,Gemini 3.8 Flash 翻译测试帖,X,2026-09-03,https://x.com/matgrimm/status/2095327171627594028
[5]: @Bhavani00007,Gemini 3.8 Flash 3D 测试帖,X,2026-09-03,https://x.com/Bhavani00007/status/2095231702813802562