六个号称「省 Token」的 Skills,有人实测完发现:一个都没省钱
实测六个号称省 token 的 AI Skills,结论:一个都没省钱。拆解「省 token」话术背后的真相,教你识别真正有效的优化方式。
先撂结论:数字越唬人,越要小心
市面上最近冒出一批「省 Token」的 Skill,一个比一个猛:有的说输出能少 65%,有的说 400 行代码能压到 23 行,还有的直接喊账单砍 70 倍。正赶上某模型要涨价,有人干脆把最火的六个全找齐,每个配一道编程题,用 API 实打实跑了一遍,又用 GPT 和 Claude 轮流盲评。
结果出乎所有人意料:这六个号称省钱的 Skill,一个都没让人省到钱。
这篇不是劝你别用这些 Skill,而是要拆开看看水有多深。有几个结论,能推翻不少人原本的认知。
六个 Skill,六条不同的省钱路子
先说它们各自的思路。方向差得远,适用场景也完全不同。
- Caveman(原始人):让模型闭嘴。删寒暄、删铺垫、删免责声明,只留结论、动作和代码。官方聊天基准称输出从 1214 token 降到 294,少 65%。
- Ponytail(马尾辫):动手前一层层盘问,已有的能不能用、标准库行不行、一行代码能不能解决,全不行才允许写新的。号称代码量能少九成。
- Headroom:压缩喂给 AI 的上下文,重复日志、大段代码先存本地,要细节再捞,宣称省六到九成。
- Graphify:嫌 Agent 每次重读整个项目,提前把代码解析成知识图谱,查图就行。宣称砍 70 倍账单的就是它。
- Codex Token Skills:把稳定不变的规则放对话最前,赌命中上下文缓存,号称省六到八成。
- Codex Token Saver:极致偷懒。改代码前不读文件、用户不要求就不测试、失败只重试一次,号称省五到八成。
光看这排数字,是不是觉得全装上就能免费白嫖 AI 了?
单独跑:有的真省,有的偷工减料
下面这几组测试数据,最能说明问题。注意,这些测试结论来自社区的公开实测,不是官方宣传。
Caveman跑坏了一道题。让它一句话生成带滚动动画和花哨配色的粗野主义网页,结果行数反而多 18.9%。因为它能删的是「解释」,可这题要的是几百行 HTML,根本没解释可删,规则就成了纯增量。唯一的好处是画面稳定度确实上来了。
Codex Token Skills 和 Headroom踩同一个坑:能省多少,取决于输入里有多少能省。一个按详细设计稿实现页面的任务,每个数字都是硬性要求必须读完,输入压不动。但让模型在一份 1.65 万 token 的长 CSS 里挑问题,Headroom 把它压到 8500,省了近一半,还避免了被截断。所以它只对又长又脏的输入有用,对又短又干净的,三次全判定为 no-op,一分钱没省。
Ponytail是真省。让做卡通激光眼,不装 675 行,装了 488 行,少了 27.7%,功能一个没少,CSS 规则从 69 条砍到 35 条。但它官方宣称的「省 92% 到 94%」得单独说:那对应的是代码行数,不是平均 token 降幅。数字艺术啊。
Graphify反转最大。「砍 70 倍」其实是旧版项目在特定大型语料上的单次查询对照。有次测试造了个 79 文件的仓库,出 20 个必须跨文件才能答的问题,实测单查询输入平均从 583 降到 163,是 3.56 倍,不是 70 倍。而且建图本身很贵:79 个文件读一遍就花 3 万 token。问了十几个问题后,不建图总共花 2.8 万,建图那组反而花 4.2 万,多了 48%,要问 36 次左右才回本。所以它只适合长期、复杂、会被反复查的仓库。
Codex Token Saver省得最猛,从 509 行压到 61 行。可逐个对功能发现,它把 4 个本该独立设计的角色合并成 1 个 SVG 模板,用 JS 循环换颜色。省是真的,但牺牲了角色差异。
终极测试:钱到底烧在哪了
单题各有胜负,横向没法比。所以有人换了打法,开「目标模式」,六个全拉到同一道题上:做电影感的世界杯页面,48 队、104 场、带倒计时,七个版本匿名打分。
结果:六个号称省钱的,一个都便宜。Headroom 是平的,剩下五个全在加钱,最少的加 33.5%,最多的加 222.8%。
钱加在哪了?翻使用额度里的 reasoning_tokens 字段,真相大白。不装 Skill 那版,模型想了 12420 token;装了某款之后,它想了 36217,可见输出只多 630。新增开销里 96% 花在了「多想一会」上。
| 版本 | thinking token | 可见输出 token |
|---|---|---|
| 不装 Skill | 12420 | 18098 |
| 装 Codex Token Skills | 36217 | 18728 |
你每条规则,模型都得先读进去、理解、再动笔前多想一轮它跟质量目标怎么协调。规则越多越严,它想得越久。辛辛苦苦算的那几笔账,管全了「说出来的」,真正烧钱的,是「没说出来的思考」。
那到底该装哪个
跑完这一轮,结论其实很简单:这些 Skill 的定位从一开始就被搞错了,它们不是省钱工具,是约束工具。
| 场景 | 值得装的 | 原因 |
|---|---|---|
| 高频、规则固定的苦力活 | Ponytail、Headroom | 砍废话和重复,真省钱 |
| 需要创意、讲质量的活 | 别装 | 约束变成思考负担,账单反涨 |
| 长期反复查询的大仓库 | Graphify | 摊平建图成本才划算 |
简单任务、规则明确、对质量没要求,约束确实能省钱。可一旦场景复杂、对质量有要求,约束就反过来变成额外的思考负担,账单也跟着涨。
所以别迷信「装了 XX Skill 就能省钱」,更别一上来就装一堆。先想清楚你的任务属于哪一类。
为了省 token 而烧掉更多 token,这事,你细品。
你平时会刻意省 token 吗?最想省钱的是哪个场景?评论区聊聊。
觉得有用请点个「在看」,让更多人避开「假省钱」的坑。