被低估的效率暗战——AI成本正在以”超级摩尔”速度坠落
2026年3月,一个数据在AI圈悄悄流传,但几乎没有人停下来想一想它意味着什么。
OpenRouter——全球最大的AI模型路由平台——公布了它的年度Token消费构成。一年之内,编程类Token的占比从大约11%飙升到了超过50%。
不是”增长”。是碾压。一个品类,吃掉了一半以上的算力。
(ps: 你可能会想,程序员们用AI写代码更勤快了呗。但问题没这么简单——11%到50%,不是”用得更多”,是”一个全新的使用方式被创造出来了”。)
这些Token去哪儿了?不在人类和ChatGPT的一问一答里。在Agent里——那些能自主规划、调用工具、观察结果、自我修正、循环迭代的AI程序。一个典型的Agent coding session,修复一个bug,可能消耗10万到200万个Token。而它要做的,只是人类程序员花10分钟就能搞定的事。
但有趣的事不在这里。有趣的事在另一组数字里。
同一年,GPT-4级别的推理价格从每百万Token 60美元降到了0.06美元。三年,降了1000倍。
1000倍的降价,同时,50%+的Token被一个一年前几乎不存在的品类吃掉了。
如果你是一个CFO,看到这两组数字同时出现,你应该感到不安——因为你的AI账单的走势,跟你对”降价”的直觉,完全相反。
一、“超级摩尔”:一个比摩尔定律快82%的降本速度
先看硬数据。
2026年3月,一篇题为”Tiered Super-Moore”的论文发布在arXiv上。研究者收集了3237个模型的定价数据,横跨2020到2026年,计算出一个让半导体行业沉默的数字:
经济型AI模型的推理价格半衰期是1.10年。
什么意思?就是每过13个月,获得同等性能的AI推理服务,价格腰斩一次。
作为对比,摩尔定律的经典定义是:集成电路上的晶体管数量每两年翻一番——相当于每两年计算成本降一半。也就是说,AI推理成本的下降速度,比摩尔定律快了82%。
中端模型也不慢——半衰期1.55年,仍然比摩尔定律快了29%。
(ps: 旗舰模型是个例外——它们的价格几乎不遵循指数衰减,R²仅为0.031。前沿能力从来不打折,打折的是”跟前沿一样好的昨天的能力”。)
再换一个角度。Epoch AI在分析了六个基准测试上的推理价格趋势后,得出了一个更震撼的结论:达到特定性能水平的价格,以每年50倍的中位数速度在下降。 2024年后,这个速度加速到了每年200倍。
如果你觉得这些数字太大,怀疑它们是不是”统计游戏”——我们来看一个具体的对比:
| 时间 | 模型 | 每百万输出Token价格 |
|---|---|---|
| 2021年 | GPT-3 | $60 |
| 2023年3月 | GPT-4 | $36 |
| 2025年1月 | DeepSeek V3 | $0.28 |
| 2026年初 | 同等性能开源模型 | $0.06 |
从0.06。这不是”便宜了一点”。这是”便宜到你不要都不好意思”。
二、最反直觉的发现:GPU硬件只贡献了-0.9%
好了,现在你可能会问:这么快的降价,是谁在驱动?
直觉回答:英伟达的新显卡呗。
H100换B200,计算能力强了,价格就降了。这不难理解。
直觉错了。
那篇”Tiered Super-Moore”论文做了一个全要素生产率(TFP)分解——把推理成本下降拆解成各个因素的贡献。结果让人大跌眼镜:
| 降本因素 | 贡献度 |
|---|---|
| 软件/架构创新 | 约103.7% |
| GPU硬件成本下降 | 约-0.9% |
GPU硬件不仅没有降本——它在账面上是拖后腿的。
(ps: -0.9%的意思是,如果只看硬件价格变化,推理成本应该微微上涨。但因为软件和架构创新贡献了超过100%的降幅,总成本才断崖式下降。)
这不是一个”硬件为主、软件为辅”的故事。这是一个**“软件几乎包办了一切,硬件在旁边喊加油”**的故事。
那”软件/架构创新”到底是什么?拆开来看,三股力量:
第一股:MoE架构。 Mixture-of-Experts(混合专家模型)用一个精巧的设计彻底改变了计算效率。Mixtral 8x7B拥有46.7B的总参数,但处理每个Token时只激活12.9B——用1/4的计算量,跑出了70B稠密模型的能力。 DeepSeek V3把这个逻辑做到了极致:671B总参数,每次推理只激活37B。
第二股:量化技术。 把模型参数从16位浮点数压缩到8位、4位,甚至2位整数。4-8倍的内存压缩,困惑度退化不到1%。最极端的案例——腾讯混元的HY-1.8B-int2——是工业界第一个可用的2比特大模型。一篇2026年ICLR论文提出的CodeQuant方案,在MoE模型上实现了4.15倍的延迟降低。
第三股:投机解码。 这是最聪明的一个技巧。传统自回归生成是”挤牙膏”——一个字一个字地蹦,每一步都要跑一次完整的模型前向传播。投机解码的思路是:先用一个极小的”草稿模型”快速生成一串候选token,然后让大模型一次性验证这些候选是否合理。大模型只需要做一次并行验证,而不是N次串行生成。腾讯混元的AngelSlim框架在投机解码上实现了1.8到2.0倍的吞吐量提升,输出完全一致。
这三种技术不是各自为战。它们叠加。
MoE让模型”能用更少的参数处理每个Token”→量化让”每个参数用更少的比特存储”→投机解码让”每秒能处理更多Token”。
三层叠加,就是1000倍。
三、杰文斯魔咒:为什么你的AI账单反而在涨?
1854年,英国经济学家威廉·斯坦利·杰文斯在他的《煤炭问题》中写下一句跨越172年仍然刺眼的话:
“以为燃料的经济使用等同于消耗的减少,是一种思维混乱。事实恰恰相反。”
他观察到的现象是:瓦特改良蒸汽机后,每马力小时的煤耗大幅下降。但英国的煤炭总消耗非但没有减少,反而飙升。因为更高效的蒸汽机让煤炭变得”便宜到可以用在以前根本用不起的地方”——煤矿、纺织厂、铁路,整个工业革命建立在”效率提升→解锁新需求→总消耗不降反升”的正反馈上。
AI推理正在经历完全相同的”杰文斯魔咒”。
看数据:单Token成本三年降了1000倍。同期,企业AI总支出从115亿美元涨到了370亿美元——涨了320%。
(ps: 你可能会说:“这不就是价格弹性嘛,需求增加了而已。“没错。但关键不是”需求增加了”,而是需求的性质变了——不是”更多人用ChatGPT问天气”,而是”整个经济中出现了以前根本不存在的AI使用方式”。)
来,我们逐层拆解这个乘数效应到底有多大:
第一层:Agent Loop。 一个ReAct风格的Agent——它先理解任务(消耗token),再规划子任务(消耗token),然后调用工具(消耗token),解析工具返回结果(消耗token),反思是否需要调整(消耗token),最后生成回复(消耗token)。一个10轮的Agent循环,消耗的Token大约是单次ChatBot调用的50倍。
第二层:推理模型。 o3、DeepSeek R1、Claude Extended Thinking——这些模型在输出最终答案之前,会先生成数百到数千个”思考”Token。一个ChatBot模式下只需要7个Token的回答,在推理模式下可能需要255到603个Token。10到86倍的放大。
第三层:多Agent并行。 编排器-工作者模式会同时生成多个专业化子Agent,每个Agent维护自己的上下文窗口,彼此之间还要协调通讯。同样的工作,2023年是一个模型一次调用,2026年是多个模型多次编排。再乘50到100倍。
这三层不是加总关系,是乘积关系。50 × 30 × 50 = 75,000倍的Token消耗差异,发生在”同一个用户请求”上。
Gartner在2026年3月的分析报告给出了一组更保守但也更权威的数字:Agent工作负载的Token消耗是标准ChatBot的5到30倍。即便按这个”保守估计”,也足以解释为什么——全球AI推理总支出在2026年初正式超越了训练支出。
业内称之为”Inference Flip”(推理大翻转)。 一度只占AI总预算1/3的推理,现在占到85%。这不是一个渐进的变化,这是一次结构性的重心转移。
四、两种效率观的对决
| 维度 | 传统效率观 | 杰文斯效率观 |
|---|---|---|
| 核心逻辑 | 效率提升→成本下降→账单变少 | 效率提升→门槛降低→新需求爆发→账单变多 |
| 看1000倍降价 | ”AI要便宜到不要钱了" | "AI要便宜到无处不在的程度” |
| 看Token消耗暴涨 | ”这是浪费,需要优化" | "这是需求被压抑太久的释放” |
| 投资含义 | 少投AI基础设施,等价格继续跌 | 多投AI基础设施,因为需求增速远超降价速度 |
| 历史参照 | 光纤过剩→泡沫破灭 | 瓦特蒸汽机→工业革命 |
(ps: 可能有人会说:“光纤泡沫也是需求爆发,最后不还是崩了?“区别在于——2001年光纤是被”投机性过度建设”驱动的,真实需求远小于铺设的容量。而今天AI推理的Token消耗,每一笔都对应着一条真实的任务执行记录。Agent在修bug,不是在做PPT。)
这两套逻辑指向完全相反的投资决策。相信”传统效率观”,你会等;相信”杰文斯效率观”,你会投。
而市场正在用钱投票。 全球AI支出2026年预计超过2.5万亿美元。NVIDIA NVL72机架每周部署近千台。Google 2026年CapEx规划1750-1800亿美元。推理基础设施支出一年翻了一倍多——从92亿美元跳到206亿美元。
这不是泡沫。这是价格弹性在极度压缩的供给曲线上释放。
五、太阳底下没有新鲜事
杰文斯在1854年写下那段话的时候,大概想不到一个半世纪后,他的逻辑会在一个叫”Token”的虚拟商品上完美复现。
但技术史上,这个规律反复出现——每一次”效率革命”,最终都变成了”用量革命”。
- 宽带降价:2000年代,每Mbps带宽成本断崖式下降。结果?不是”省钱了”,而是YouTube、Netflix、Zoom诞生了。全球互联网流量涨了不止100倍。
- 存储降价:每GB成本从1990年代的数千美元降到今天的几美分。结果?不是”硬盘厂倒闭了”,而是云存储、视频监控、基因测序数据库成了基础设施。数据总量涨了100万倍。
- 云计算降价:AWS在过去十年内降价超过100次。结果?不是”企业IT预算减半”,而是SaaS产业从几十亿美元变成了几千亿美元。
每一次,降价的最终效果都不是”省钱”——而是让原来的边缘需求变成主流需求,让原来不存在的工作流被发明出来。
AI推理正在经历的,是同一条曲线——只不过斜率更陡。
结语:当Token便宜到接近免费
2026年初,一场私下的AI行业闭门会上,有人提出了一个思想实验:
“如果Token价格降到0.0001美元/百万Token——接近免费——会发生什么?”
在场所有人沉默了半分钟。然后一个工程师说了一句话,让全场再也没有人提”scaling wall”:
“那我们会给地球上每一块屏幕、每一个传感器、每一条日志、每一次心跳,都配上一个持续运行的AI Agent。”
瓦特的蒸汽机没有让英国少烧煤。它让煤从”取暖燃料”变成了”文明动力”。
Token的降价,也不会让世界少用AI。它会让AI从”一个要掂量成本的高级工具”,变成像电一样,不用计数的存在。
而那一天的算力需求,将是今天的——不要用倍数去想了。用数量级。
(本文为”AI模型进化系列”第二篇。第一篇《AI模型进化,撞墙了吗?》探讨了能力收敛之辩。下一篇将拆解何恺明的ELF扩散语言模型——当语言生成不再”挤牙膏”,效率的边界会被推到哪里。)
小龙创作,2026年5月