Token 额度总是不够用?这28条省钱办法,Codex、Claude Code、Kimi 都能用

省额度是手段,把事一次做对才是目的。

这几个月我手里开着一堆订阅:Claude、ChatGPT 各一份,国内的 Kimi、GLM、阿里云百炼也定了好几个月套餐,英伟达老黄的免费 Token 蹭了好久,DeepSeek 的 API 一直挂着。加起来每个月花的钱都不是小数目。
以前额度管够,烧就烧了,没太在意。现在各家一边涨价、一边砍额度、一边限购,同样的钱,能干的活肉眼可见地变少——再大手大脚,就是往水里扔钱。省 Token 这件事,一下从"抠门"变成了"不省不行"。
我日常看到公众号、X 上的省 Token 方法都会尝试,去重、去玄学、去掉要违规的,自己试过之后剩下这些。热榜是一些反常识(因为我之前也这样想,实际上并不对)的经验,个人觉得特别有用


01.
零成本先做,不用装任何东西
图片

先说最省钱、又不用装任何东西的一档。它们全指向同一件事:你每问一句,都在为这个会话之前的全部历史重新付一次钱,会话越长越贵(钱到底怎么算、为什么"前几天便宜一周后变贵",我在《"养龙虾"的费用到底是怎么算的?》里讲过)。所以第一组招,核心就一句话——别让历史越滚越厚
1. 换个任务,或者会话跑脏了,就重开。 修完登录的 bug 要去写个新接口,别在同一个会话里接着聊;一个会话跑久了、跑偏了、堆满上一件事的文件和试错,也别硬撑——/clear 清掉,或者直接开个新的。道理是同一个:会话越长,它每开口前都要把前面所有东西重读一遍,全在陪着你现在这个问题一起收费。这是最省钱的一个习惯,没有之一。
2. 跨天的活,写份交接文件,让新会话接手。 一件事要做好几天,别把几百轮的历史一直拖着跑。收工前让它把"做到哪、下一步、踩过的坑"写进一个交接文件;第二天开个全新会话,只读这份文件接着干。相当于把一整箱旧对话,换成一页纸的备忘。
3. 不想换会话,就让它就地总结一下再往下走。 上一条是"关掉、写成文件、新会话来读",这条是不关会话、就地瘦身。手头这摊还没弄完、又嫌历史太重时,让它把目前的进展和结论压成一小段,然后基于这段摘要继续,把前面几十轮的啰嗦原文甩掉。会话没长到要交接的程度时,这个更顺手。
4. 架构类的问题,给它图别给它长篇大论。 一张结构图和几段文字装的信息差不多,但 Token 少得多,模型对结构化的东西理解还更快。
5. 读多写少的活才交给子智能体,别指望它省钱。 多个分身并行是省你的时间,不省 Token——每个分身都要自己读一遍上下文,账单是叠加的(而且写代码的活并行还会打架)
6. 复杂任务,先让它出计划,你点头了再让它动手。 直接扔一句"把这个模块重构了",它可能闷头改一大片,方向错了整摊子白烧。让它先给一版计划——准备改哪些文件、怎么改,你扫一眼方向对不对,再放它执行。多问这一句的成本,比它做完一版错的再返工低得多。


02.
配置一次,长期省
图片

7. AGENTS.md / CLAUDE.md 写短。 每次会话开局都要完整读一遍,你今天只改个错别字,它也全文照读。短到什么程度?一份能用的骨架,80行上下就够了(Codex 对这文件其实有个 32 KB 的合并上限,但真写到那量级,早就啰嗦得没法看了)。这份文件怎么写、放哪一层、和"记忆"有什么区别,我在《Codex 配置完全指南》里专门讲过;这里加一句和省钱直接相关的:写进去的每一行,都在每次会话里重复烧。
8. 少挂 MCP——这条最反直觉。 每个 MCP 服务器都会把自己那几十个工具的说明书塞进你的每一条消息,一个工具的说明就要400到800 Token。有人实测接了 4 个 MCP、100多个工具,一行提示词没写,差不多 6 万 Token 先没了,20 万的上下文窗口开工前就去掉 1/3,所以用不到的MCP直接关掉,需要再开。
9. 技能、插件别装太多。 装着的技能光名字和描述就占着上下文预算,装多了,工具会自己把描述压短、甚至悄悄省略掉一部分(这个我深有体会,最多的时候我装了差不多400个skill,实际用到的并不多;现在只有自己创建和常用的十几个)——你以为它在一堆技能里挑错了,其实那几个它压根没看见。挑常用的留着就行。
10. 联网搜索默认走缓存,要实时再开。 有些工具默认用缓存过的搜索结果,一是省 Token,二是防坑(有人会在网页里塞一句"忽略前面所有指令"来诱导 AI),用缓存能把这风险压下去。真需要最新的信息,再手动开实时联网,平时没必要每次都联。
11. 省钱不是全程用便宜模型,是"该强的时候强、该弱的时候弱"。 大家都知道小模型省额度(同套餐下便宜模型的额度能是旗舰的几倍),于是干脆全程用便宜的——结果难题它做不动,反复返工反而更贵。真正的分工是让最强的模型只做拆解难题、定方案,具体执行交给便宜快的。但这里有个大部分人忽略的代价:在同一个会话里换来换去地切模型,会打破缓存,后面全按原价算。所以分工要按"会话"分,一个会话干一类活,不是在一条对话里切来切去。
12. 配一次"别碰这些目录",长期省得它扫垃圾。 这条和后面"任务圈小"不一样——那是每次下指令临时说,这条是一次性写进配置、长期生效。项目里的 node_modules、打包产物、日志、自动生成的文件,AI 一扫进去全是钱又没用。在配置或 AGENTS.md 里划一句"这些目录别动",配好一劳永逸。


03.
少喂废话,也少让它写废话
图片

13. 只给它这个任务真正要用的东西。 两个方向:一是把范围圈小,"帮我检查整个项目"会让它把几百个文件全扫一遍,换成"只看 XX 目录下的登录逻辑,别碰别的"就省一大截;二是你主动喂参考资料时,别把整个文件夹、整篇几万字的文档甩过去让它自己找,挑相关的那几段再给。"多给点它更懂"这个直觉,在花钱这件事上是反的。(注意:上一条12是配置里常驻的忽略规则,这条是你每次开口时的临时圈定。)
14. 让它输出多少,你说了算——输出比输入贵好几倍。 同样烧 Token,输出那部分的单价通常是输入的好几倍。所以别放任它话痨:要多长、什么格式、先做必须的还是连可选的一起做,一次说清。一句"简单说下结论就行",能省下它一大段没人看的铺垫。
15. 要它消化一大堆资料,先压成摘要再喂。 让 AI 直接读几十份 PDF、几十个网页,是笔巨款。可以先用专门的工具(比如 Google 的 NotebookLM)把这些资料读成一份带出处的摘要,AI 只接这份摘要、不碰原文。既省 Token,答案还带引用、不容易瞎编。
16. PDF 别直接喂,先转成文本。 PDF 里塞着大量排版信息,直接丢给 AI 很亏。微软有个免费工具叫 MarkItDown,把 PDF 转成 Markdown 纯文本再喂,能省差不多 7 成 Token(豆包这类也能转)。这条跟你用哪个 AI 无关,Codex、Claude、Kimi 都适用。表格多的 PDF 转完可能读不清,把表格单独转成 HTML 再插进去。
17. 终端输出大多是废话,让 AI 少读点。 你跑一个测试,两百行日志里真正有用的可能就那句报错,剩下的进度条、通过的用例、重复的警告,AI 全都要读、全都算钱。思路是:在把这些输出喂给 AI 之前先过滤一道,只留关键的。这类工具是有的(社区里有人做,比如 RTK),我自己没深用就不展开推荐了,但"别让 AI 读一屏没用的输出"这个方向,值得你留个心。


04.
分工具的额外补丁
图片

Codex:
18. 额度快见底时,塞一个长任务进去。 官方规则写着:额度用尽时,正在跑的这一轮可以继续跑完(有合理使用约束)。所以趁没断把一个复杂长任务丢进去,它能带着跑完。X 上的老哥们为这个吵过一架,其实官方一句话就说清了——机制真的有,但别当无限薅。
Kimi(这周刚改完会员制,单独说)
19. Kimi 的账单几乎由"缓存命中率"决定,而命中是有办法的。 K3 的 API 价是每百万 Token 输入 3 美元、输出 15 美元,但缓存命中的输入只要 0.3 美元,差十倍。
怎么让它命中:把每次都不变的东西(系统提示、项目背景、那份长文档)放在请求的最前面,而且一个字都别改;把每次变动的内容放到后面。一旦你中途换了模型、临时加了工具、或者把前面那段动了一下,缓存就断了,后面全按原价算。
这套逻辑其实各家通用,Kimi 只是价差特别大,最值得抠。
20. Kimi 切模型也要新开会话。 K3 默认开最高强度思考,旧会话里堆的思考历史会污染新任务,既占窗口又烧额度。
21. 老 Kimi 用户,先别急着升级。 新体系把会员拆成"通用"和"编程"两档要分开付费,纯编程入门档不含网页和 App,要高速加百万上下文的档位从 199 涨到 299。但官方没公开新旧额度的直接对比,加的量能不能抵掉涨价和砍掉的权益,现在看不清。好在老套餐不强制迁移,现有用户没有明显理由主动切。
Cursor:
22. 让它自己挑便宜模型,规则文件写精简。 Cursor 的 Auto 模式会按任务难易自动选模型,简单的活不会默认拿最贵的去干,日常开着就能省一截。另外那份 .cursorrules(相当于 Cursor 的项目说明书)跟前面说的 AGENTS.md 一个道理——写得越长,每次对话背的包越重,能精简就精简。
DeepSeek:
23. 能等的活,挪到半夜跑。 DeepSeek 的 API 有错峰价,每天深夜(北京时间 0:30 到 8:30)调用直接半价。批量的、不急的活——跑数据、批量整理、离线分析——用定时任务放到那个点跑,一样的活省一半。注意只对按 Token 计费生效,包月套餐不算这个。
通用:
24. 同一个重活,先比一眼各家单价再决定放哪跑。 各家的 Token 单价、缓存折扣都不一样,差起来不是一星半点。真正吃量的大任务,动手前花一分钟比比:这活放 Codex、放 Kimi、还是挂某家 API 更划算。小活无所谓,重活值得挑个地方。


05.
几个要当心的地方
图片

25. 随手让它生成图片,额度掉得特别快。 让 AI 生成或修改图片,会按平时三到五倍的速度吃额度。偶尔用没事,但别拿它当图片工具批量生图,几张下去额度就见底了。
26. 别开了自动模式就去睡觉。 让它自动跑长任务、一口气连着做好几个子任务的时候,先大致想一下这摊子活要烧多少。开着自动模式、无人值守地让它跑一宿,回来很可能看到的是一份没做完的活,加一个见底的额度。给它划个范围,或者盯着点关键节点。
27. 灰产别碰。 网上那些"额度重置教程""号池""闲鱼买号""土耳其区订阅""反代",甚至有人晒批量注册卖号日入几万——这些要么封号,要么涉及账号安全和合规,省下来的那点钱不够赔的。千万慎重。
28. 教程和攻略随时更新,不要死守不放。 最典型的是"巧用 5 小时窗口"那套:有教程教你算准时间、提前发条消息把额度重置卡到你上班的点,等于一天白蹭两个窗口。写的时候是神技,前段时间Codex 这个月把 5 小时限制取消了,这招对它一夜作废(对还留着 5 小时窗口的 Claude Code 才有用)。你现在看到的任何一条省法——包括这篇里的——都可能因为某次更新就失效。


06.
总结一下
图片

X 上有条被转了很多的话,大意是——真正的省 Token 技巧不是什么上下文压缩、子智能体工程,而是"你先去 GitHub 上搜一下,有没有现成的、半成品的方案"。最省的那一笔,是本来就不用花的那一笔。
OpenAI 自己也换了个说法:别只盯着 Token 单价,去算每个成功任务的完整成本——包括反复重试、人工返工、失败重来。单价再低,一件事让它做五遍才做对,也不便宜。
省额度是手段,把事一次做对才是目的。