GLM-5.2 刷屏两周后,这场仗已经不在跑分里了
用户买的不是权重,是权重外面那圈工程
官方 Coding Plan 抢不到,几轮蹲守都没上车,倒卖中转的先赚了一波;有人在 Mac Studio 上把它压到 1-bit 本地跑起来,截图配文"效果超过 Opus";时间线上到处是"上一次国产模型在海外这么轰动,还是 DeepSeek 时刻"。同一时间,大洋对岸在骂人。Anthropic 的 CEO Dario Amodei 被钉在 Reddit 头条上骂了一整周,罪名是恐惧营销、抹黑开源。一篇标题就叫《我恨 Dario Amodei》的帖子,1700 赞。一边是"国产赢了",一边是"闭源慌了"。两边情绪都很高,也都有真材实料垫底。但这两种热闹拼在一起,恰好盖住了这几周最重要的一个信号:6 月 28 日,周日,一家加密货币媒体发文:《Anthropic CEO 向国会警告开源 AI 风险》。[1]报道里没有听证会日期,没有原始链接,文末只标了一个转载来源。文中 Dario 的"警告",逐句对得上 2023 年 7 月 26 日参议院听证会的记录。三年前他的原话是:"开源模型规模化的路径,正走向一条非常危险的道路。模型一旦以不受控的方式发布,你就再也没有能力干预,它完全脱离你的掌控。"[2]这段三年前的证词,就这样以新闻的身份复活,经加密货币账号 Coin Bureau 配图转发,[3]48 小时冲上 Reddit 本地模型社区头条,3400 赞。[4]评论区最高赞是一条疑问:"2023 年 7 月的话,怎么就成了 breaking news?"底下一条 264 赞的跟评给出了一种答案:"如果你是 Polymarket,想挪一挪盘口的赔率,它就是 breaking news。"那篇 1700 赞的《我恨 Dario Amodei》,驳斥了 Dario 的三句话:"闭源模型看不到内部","开源的协作红利在 AI 上不成立","最终你还得托管在云上"。这三句确实是 Dario 说的,出处却既不是国会也不是本周,是一年前的一档播客访谈。[5][6]评论区有人追问出处,作者坚称是"6 月 28 日的国会听证"。三年前的证词,周日经加密媒体加工成新闻,经加密大号转发放大,和一年前的访谈搅在一起,变成几万人的道德审判,再被中文科技号打包成《开源是伪命题》《旧证词全网炸锅》,一周四篇。6 月 1 日,Anthropic 向美国证监会秘密递交上市申请,媒体给的估值区间摸到万亿美元;[7]6 月 16 日,GLM-5.2 发布。一家万亿估值的闭源公司排队上市,一个开源模型贴脸追上来,"闭源 CEO 害怕开源"的故事在这个节骨眼上不缺买家。不过,拼出来的料能点着这么大一场火,有个前提:火药得是真的。智谱自报的成绩单是这样的:终端任务基准 Terminal-Bench 2.1 上 81.0 分,Claude Opus 4.8 是 85.0,差 4 分。[8]第三方竞技场 Code Arena 的前端榜上,它排第二,只排在 Fable 5 后面,Claude 其余型号都被它压在身下。[9]价格比分数更扎眼。有开发者让 GLM-5.2 和 Opus 4.8 各写一个落地页,效果肉眼难分:一个 6 美分,一个 49 美分。[10]八倍价差,效果打平。一次测试当然说明不了全部,但它逼出来的问题很实在:这类东西到底该卖多少钱。本地化走得更远。社区把 GLM-5.2 量化(把模型精度压缩到消费级硬件塞得下)到 1-bit,一台 Mac Studio 就跑得动;[11]有人拿 2-bit 版本日常干活,声称效果不输 Opus 4.8。[12]这话水分多少另说,但"自己电脑上跑一个贴近旗舰的模型",放在一年前不存在这个选项。冲上来的也不只智谱一家。7 月 2 日,Kimi K2.7 Code 进入 GitHub Copilot 模型选单,是第一个进去的开放权重模型;[13]7 月 5 日,美团把 LongCat-2.0 用 MIT 协议完全开源,1.6 万亿参数,100 万 token 上下文。[14]所以"DeepSeek 时刻 2.0"的说法,对了一半:权重这一层,差距确实在肉眼可见地合拢。Reddit 那波怒潮里,有个帖子没跟着骂,安静拿了 1000 多赞。它提的问题值得原样抄下来:"当 Claude 在跑分上碾压 GLM-5.2,大家默认 Anthropic 有更强的架构和训练技术。但这个推论不成立。因为跑分对比的,是 GLM 的裸模型推理,和 Claude 这个完整产品。你不知道那个产品在幕后做了什么。"[15]API 那扇门背后,可能有针对场景的知识注入,有提示词预处理,有隐藏的工具调用,有模型之间的派单调度。一条 196 赞的回复说得更直白:"你问 Opus 的问题,可能是便宜模型在答,按 Opus 计费。"这是猜测,没人拿得出证据,但拿不出证据这件事本身,就是那扇门的功能。另一条高赞干脆挑明:我们以为在和一个模型聊天,其实在和一条流水线聊天。天平的一端是一块权重,另一端是一整套设备。跑出来的那 4 分差距,可能是模型的差距,也可能是"裸模型"和"全副武装"的差距。隔着那扇门,你分不出来。而这个分不出来,本身就是闭源的定价权。行内管这套设备叫 harness,直译是"挽具",说人话,就是把马力变成拉力的那套家伙什:上下文管理、工具调度、失败重试、安全护栏。带着这个词回头读 Dario 一年前那段被骂翻的访谈,味道全变了。他说"开源在 AI 里其实是个红鲱鱼"(red herring,转移视线的假线索),说"开源不是免费的,你得让它在推理设施上跑起来,最终还是要托管在云上"。[6]骂他的人听到的是:他在贬低开源。平放着看,这几句话说的是另一件事:单独一块权重,构不成一个能用的东西。他点到的只是最底下的一层,机房和推理设施;顺着同一个逻辑往上走,就会撞到那圈工程:托管解决权重在哪跑,harness 解决权重怎么被用对。Anthropic 卖的从来不是权重本身,是权重加上这整套东西。所以 Dario 那句话真正的问题不是说错,是只说了一半。他辩护的东西,和大家攻击的东西,压根不在同一层。这种错位不只发生在 Reddit。中文用户的使用体感里,同一层东西早就露头了。小红书上,一位用户 7 月 6 日发了条 GLM-5.2 长篇实测,六个维度逐项对比 Claude,结论里有一句:"之前像 Sonnet,依赖 harness 脚手架;现在是 Opus,编排、规划、元认知能力显著提升。"[16]一个普通用户,已经在拿 harness 当标尺,量一个模型离开脚手架还能走多远。6 月 26 日,一条标题就叫《GLM5.2 盛名之下,其实难副》的帖子,讲楼主一个问题烧掉 16 美元、模型原地转圈。评论区没有一边倒地护短,吵的全是具体问题:有人现身说法,"得在 Claude Code 里接 API 用,在 open code 里真没那么聪明,体验完全不一样";有人怀疑第三方渠道偷偷降了精度;有人对比官方满血版和中转站到底差多少。[17]吵到最后也没有结论,因为病根在模型还是在渠道,隔着一层 API 谁都拿不出证据。这个"拿不出证据",就是上一节说的那扇门,只不过这回,门是第三方中转商的。你要是也用过 GLM,多半撞到过这个现象。夸它的人在夸权重,骂它的人在骂 harness。和 Reddit 骂 Dario 一样,吵的不是同一个东西。7 月 1 日,智谱发布 ZCode,GLM-5.2 的官方开发环境,订阅用户 1.5 倍额度。[18]自建夹具。7 月 2 日,Kimi 进入 Copilot 模型选单。入驻别人的夹具。7 月 5 日,美团 LongCat-2.0 的开源发布物里,直接附带对 Claude Code、OpenClaw 等工具的适配。[14]借用对手的夹具。三家路线不同,指向同一个判断:光把权重放出来,赢不了这场仗。权重要装上工装才能干活,而工装在谁手里,用户就留在谁那里。LongCat 那份发布清单里有个容易划过去的细节:一个开源模型的官方发布物,预装的是竞争对手的开发工具适配。放在传统软件业近乎不可想象,但在 2026 年的 AI 业就是常识。Claude Code 是眼下最厚的那套夹具,任何权重想被真实用起来,都得先过它。"开源什么时候打败闭源"这个问题,厂商们已经用行动改写了:跑分上的胜负还会反复,夹具上的仗才刚开始。同一个工具,有人跑得飞快,有人反复抽风,差别常常不在提示词,在配置和系统设计。到了 5 月,我干脆动手给自己的 AI 助手写了一套协作规则,当时留下过一句话:harness 不负责让 AI 表演"懂你",它是一套上工位前的安全带和夹具,让能力被用在合适的位置上。等招股书公开那天,华尔街要给 Anthropic 定价的,不是模型在跑分上还领先的那几分,那几分开源每个季度都在啃。要定价的是另一个问题:当权重变成大宗商品,围着权重建起来的那圈工程,值多少钱,守得住多久。那个 harness 帖子下面,最高赞的诉求不是更强的开源模型,是"开箱即用的开源流水线,和把任何模型插进任何框架的标准"。[15]哪天这个东西成熟了,开源出来的不只是权重,还有整套夹具,闭源最后一圈护城河也就保不住了。到那天回看这场骂战,火力从头到尾都对错了靶子。靶子不在他说出口的那半句里,在他没说完的那半句里。[1]: Phemex News,《Anthropic CEO Warns of Open-Source AI Risks to Congress》,2026-06-28,https://phemex.com/news/article/anthropic-ceo-warns-congress-of-opensource-ai-risks-91035[2]: Office of Senator Richard Blumenthal,《Blumenthal Questions Anthropic CEO & Academic Leaders About Principles for Regulating Artificial Intelligence》,blumenthal.senate.gov,2023-07-27,https://www.blumenthal.senate.gov/newsroom/press/release/blumenthal-questions-anthropic-ceo-and-academic-leaders-about-principles-for-regulating-artificial-intelligence[3]: @coinbureau,Dario Amodei 2023 年参议院证词截图推文,X,2026-06-28,https://x.com/coinbureau/status/2071330294452666695[4]: r/LocalLLaMA,《on Dario's statement》,Reddit,2026-06-30,https://www.reddit.com/r/LocalLLaMA/comments/1uj2yym/[5]: r/LocalLLaMA,《I Hate Dario Amodei, and everything he stands for.》,Reddit,2026-06-30,https://www.reddit.com/r/LocalLLaMA/comments/1uj7xcs/[6]: Big Technology Podcast(Alex Kantrowitz),《Anthropic CEO Dario Amodei: AI's Potential, OpenAI Rivalry, GenAI Business, Doomerism》,YouTube,2025-07-30,https://www.youtube.com/watch?v=mYDSSRS-B5U[7]: Clare Duffy, Lisa Eadicicco, Hadas Gold,《Anthropic files to go public in a potentially trillion-dollar debut》,CNN Business,2026-06-01,https://www.cnn.com/2026/06/01/tech/anthropic-ipo-filing[8]: Z.ai,《GLM-5.2: Built for Long-Horizon Tasks》,Z.ai 官方博客,2026-06-16,https://z.ai/blog/glm-5.2[9]: @arena,Code Arena Frontend 榜单公告,X,2026-06-17,https://x.com/arena/status/2066957802741043641[10]: @nutlope,GLM-5.2 与 Opus 4.8 落地页成本对比,X,2026-06-18,https://x.com/nutlope/status/2067313679951941686[11]: @UnslothAI,《1-bit GLM-5.2 GGUF vs. Claude 4.8 Opus vs. GPT-5.5》,X,2026-06-23,https://x.com/UnslothAI/status/2069418532375564484[12]: @AlexFinn,GLM 5.2 本地 2-bit 量化运行体验,X,2026-06-19,https://x.com/AlexFinn/status/2067751557379297762[13]: GitHub,《Kimi K2.7 is now available in GitHub Copilot》,GitHub Changelog,2026-07-01,https://github.blog/changelog/2026-07-01-kimi-k2-7-is-now-available-in-github-copilot/[14]: Meituan LongCat,LongCat-2.0 开源发布,X,2026-07-05,https://x.com/Meituan_LongCat/status/2073768940078317713[15]: r/LocalLLaMA,《The gap between closed and open models might be much smaller than commonly assumed》,Reddit,2026-07-02,https://www.reddit.com/r/LocalLLaMA/comments/1ukp2bu/[16]: 小红书用户,《这个年代为什么夸 glm5.2 的感觉像做贼一样》,小红书,2026-07-06,https://www.xiaohongshu.com/explore/6a4ae47b000000000f031f66[17]: 小红书用户,《GLM5.2 盛名之下,其实难副》及评论区,小红书,2026-06-26,https://www.xiaohongshu.com/explore/6a3d72e80000000011011298[18]: @Zai_org,《Introducing ZCode, the official development environment for GLM-5.2》,X,2026-07-01,https://x.com/Zai_org/status/2072349453361557898