被低估的效率暗战——AI成本正在以”超级摩尔”速度坠落


2026年3月,一个数据在AI圈悄悄流传,但几乎没有人停下来想一想它意味着什么。

OpenRouter——全球最大的AI模型路由平台——公布了它的年度Token消费构成。一年之内,编程类Token的占比从大约11%飙升到了超过50%。

不是”增长”。是碾压。一个品类,吃掉了一半以上的算力。

(ps: 你可能会想,程序员们用AI写代码更勤快了呗。但问题没这么简单——11%到50%,不是”用得更多”,是”一个全新的使用方式被创造出来了”。)

这些Token去哪儿了?不在人类和ChatGPT的一问一答里。在Agent里——那些能自主规划、调用工具、观察结果、自我修正、循环迭代的AI程序。一个典型的Agent coding session,修复一个bug,可能消耗10万到200万个Token。而它要做的,只是人类程序员花10分钟就能搞定的事。

但有趣的事不在这里。有趣的事在另一组数字里。

同一年,GPT-4级别的推理价格从每百万Token 60美元降到了0.06美元。三年,降了1000倍。

1000倍的降价,同时,50%+的Token被一个一年前几乎不存在的品类吃掉了。

如果你是一个CFO,看到这两组数字同时出现,你应该感到不安——因为你的AI账单的走势,跟你对”降价”的直觉,完全相反。


一、“超级摩尔”:一个比摩尔定律快82%的降本速度

先看硬数据。

2026年3月,一篇题为”Tiered Super-Moore”的论文发布在arXiv上。研究者收集了3237个模型的定价数据,横跨2020到2026年,计算出一个让半导体行业沉默的数字:

经济型AI模型的推理价格半衰期是1.10年。

什么意思?就是每过13个月,获得同等性能的AI推理服务,价格腰斩一次。

作为对比,摩尔定律的经典定义是:集成电路上的晶体管数量每两年翻一番——相当于每两年计算成本降一半。也就是说,AI推理成本的下降速度,比摩尔定律快了82%。

中端模型也不慢——半衰期1.55年,仍然比摩尔定律快了29%。

(ps: 旗舰模型是个例外——它们的价格几乎不遵循指数衰减,R²仅为0.031。前沿能力从来不打折,打折的是”跟前沿一样好的昨天的能力”。)

再换一个角度。Epoch AI在分析了六个基准测试上的推理价格趋势后,得出了一个更震撼的结论:达到特定性能水平的价格,以每年50倍的中位数速度在下降。 2024年后,这个速度加速到了每年200倍。

如果你觉得这些数字太大,怀疑它们是不是”统计游戏”——我们来看一个具体的对比:

时间模型每百万输出Token价格
2021年GPT-3$60
2023年3月GPT-4$36
2025年1月DeepSeek V3$0.28
2026年初同等性能开源模型$0.06

0.06。这不是”便宜了一点”。这是”便宜到你不要都不好意思”。


二、最反直觉的发现:GPU硬件只贡献了-0.9%

好了,现在你可能会问:这么快的降价,是谁在驱动?

直觉回答:英伟达的新显卡呗。

H100换B200,计算能力强了,价格就降了。这不难理解。

直觉错了。

那篇”Tiered Super-Moore”论文做了一个全要素生产率(TFP)分解——把推理成本下降拆解成各个因素的贡献。结果让人大跌眼镜:

降本因素贡献度
软件/架构创新约103.7%
GPU硬件成本下降约-0.9%

GPU硬件不仅没有降本——它在账面上是拖后腿的。

(ps: -0.9%的意思是,如果只看硬件价格变化,推理成本应该微微上涨。但因为软件和架构创新贡献了超过100%的降幅,总成本才断崖式下降。)

这不是一个”硬件为主、软件为辅”的故事。这是一个**“软件几乎包办了一切,硬件在旁边喊加油”**的故事。

那”软件/架构创新”到底是什么?拆开来看,三股力量:

第一股:MoE架构。 Mixture-of-Experts(混合专家模型)用一个精巧的设计彻底改变了计算效率。Mixtral 8x7B拥有46.7B的总参数,但处理每个Token时只激活12.9B——用1/4的计算量,跑出了70B稠密模型的能力。 DeepSeek V3把这个逻辑做到了极致:671B总参数,每次推理只激活37B。

第二股:量化技术。 把模型参数从16位浮点数压缩到8位、4位,甚至2位整数。4-8倍的内存压缩,困惑度退化不到1%。最极端的案例——腾讯混元的HY-1.8B-int2——是工业界第一个可用的2比特大模型。一篇2026年ICLR论文提出的CodeQuant方案,在MoE模型上实现了4.15倍的延迟降低。

第三股:投机解码。 这是最聪明的一个技巧。传统自回归生成是”挤牙膏”——一个字一个字地蹦,每一步都要跑一次完整的模型前向传播。投机解码的思路是:先用一个极小的”草稿模型”快速生成一串候选token,然后让大模型一次性验证这些候选是否合理。大模型只需要做一次并行验证,而不是N次串行生成。腾讯混元的AngelSlim框架在投机解码上实现了1.8到2.0倍的吞吐量提升,输出完全一致。

这三种技术不是各自为战。它们叠加

MoE让模型”能用更少的参数处理每个Token”→量化让”每个参数用更少的比特存储”→投机解码让”每秒能处理更多Token”。

三层叠加,就是1000倍。


三、杰文斯魔咒:为什么你的AI账单反而在涨?

1854年,英国经济学家威廉·斯坦利·杰文斯在他的《煤炭问题》中写下一句跨越172年仍然刺眼的话:

“以为燃料的经济使用等同于消耗的减少,是一种思维混乱。事实恰恰相反。”

他观察到的现象是:瓦特改良蒸汽机后,每马力小时的煤耗大幅下降。但英国的煤炭总消耗非但没有减少,反而飙升。因为更高效的蒸汽机让煤炭变得”便宜到可以用在以前根本用不起的地方”——煤矿、纺织厂、铁路,整个工业革命建立在”效率提升→解锁新需求→总消耗不降反升”的正反馈上。

AI推理正在经历完全相同的”杰文斯魔咒”。

看数据:单Token成本三年降了1000倍。同期,企业AI总支出从115亿美元涨到了370亿美元——涨了320%。

(ps: 你可能会说:“这不就是价格弹性嘛,需求增加了而已。“没错。但关键不是”需求增加了”,而是需求的性质变了——不是”更多人用ChatGPT问天气”,而是”整个经济中出现了以前根本不存在的AI使用方式”。)

来,我们逐层拆解这个乘数效应到底有多大:

第一层:Agent Loop。 一个ReAct风格的Agent——它先理解任务(消耗token),再规划子任务(消耗token),然后调用工具(消耗token),解析工具返回结果(消耗token),反思是否需要调整(消耗token),最后生成回复(消耗token)。一个10轮的Agent循环,消耗的Token大约是单次ChatBot调用的50倍

第二层:推理模型。 o3、DeepSeek R1、Claude Extended Thinking——这些模型在输出最终答案之前,会先生成数百到数千个”思考”Token。一个ChatBot模式下只需要7个Token的回答,在推理模式下可能需要255到603个Token。10到86倍的放大。

第三层:多Agent并行。 编排器-工作者模式会同时生成多个专业化子Agent,每个Agent维护自己的上下文窗口,彼此之间还要协调通讯。同样的工作,2023年是一个模型一次调用,2026年是多个模型多次编排。再乘50到100倍。

这三层不是加总关系,是乘积关系。50 × 30 × 50 = 75,000倍的Token消耗差异,发生在”同一个用户请求”上。

Gartner在2026年3月的分析报告给出了一组更保守但也更权威的数字:Agent工作负载的Token消耗是标准ChatBot的5到30倍。即便按这个”保守估计”,也足以解释为什么——全球AI推理总支出在2026年初正式超越了训练支出。

业内称之为”Inference Flip”(推理大翻转)。 一度只占AI总预算1/3的推理,现在占到85%。这不是一个渐进的变化,这是一次结构性的重心转移


四、两种效率观的对决

维度传统效率观杰文斯效率观
核心逻辑效率提升→成本下降→账单变少效率提升→门槛降低→新需求爆发→账单变多
看1000倍降价”AI要便宜到不要钱了""AI要便宜到无处不在的程度”
看Token消耗暴涨”这是浪费,需要优化""这是需求被压抑太久的释放”
投资含义少投AI基础设施,等价格继续跌多投AI基础设施,因为需求增速远超降价速度
历史参照光纤过剩→泡沫破灭瓦特蒸汽机→工业革命

(ps: 可能有人会说:“光纤泡沫也是需求爆发,最后不还是崩了?“区别在于——2001年光纤是被”投机性过度建设”驱动的,真实需求远小于铺设的容量。而今天AI推理的Token消耗,每一笔都对应着一条真实的任务执行记录。Agent在修bug,不是在做PPT。)

这两套逻辑指向完全相反的投资决策。相信”传统效率观”,你会等;相信”杰文斯效率观”,你会投。

而市场正在用钱投票。 全球AI支出2026年预计超过2.5万亿美元。NVIDIA NVL72机架每周部署近千台。Google 2026年CapEx规划1750-1800亿美元。推理基础设施支出一年翻了一倍多——从92亿美元跳到206亿美元。

这不是泡沫。这是价格弹性在极度压缩的供给曲线上释放


五、太阳底下没有新鲜事

杰文斯在1854年写下那段话的时候,大概想不到一个半世纪后,他的逻辑会在一个叫”Token”的虚拟商品上完美复现。

但技术史上,这个规律反复出现——每一次”效率革命”,最终都变成了”用量革命”。

  • 宽带降价:2000年代,每Mbps带宽成本断崖式下降。结果?不是”省钱了”,而是YouTube、Netflix、Zoom诞生了。全球互联网流量涨了不止100倍。
  • 存储降价:每GB成本从1990年代的数千美元降到今天的几美分。结果?不是”硬盘厂倒闭了”,而是云存储、视频监控、基因测序数据库成了基础设施。数据总量涨了100万倍。
  • 云计算降价:AWS在过去十年内降价超过100次。结果?不是”企业IT预算减半”,而是SaaS产业从几十亿美元变成了几千亿美元。

每一次,降价的最终效果都不是”省钱”——而是让原来的边缘需求变成主流需求,让原来不存在的工作流被发明出来。

AI推理正在经历的,是同一条曲线——只不过斜率更陡。


结语:当Token便宜到接近免费

2026年初,一场私下的AI行业闭门会上,有人提出了一个思想实验:

“如果Token价格降到0.0001美元/百万Token——接近免费——会发生什么?”

在场所有人沉默了半分钟。然后一个工程师说了一句话,让全场再也没有人提”scaling wall”:

“那我们会给地球上每一块屏幕、每一个传感器、每一条日志、每一次心跳,都配上一个持续运行的AI Agent。”

瓦特的蒸汽机没有让英国少烧煤。它让煤从”取暖燃料”变成了”文明动力”。

Token的降价,也不会让世界少用AI。它会让AI从”一个要掂量成本的高级工具”,变成像电一样,不用计数的存在。

而那一天的算力需求,将是今天的——不要用倍数去想了。用数量级


(本文为”AI模型进化系列”第二篇。第一篇《AI模型进化,撞墙了吗?》探讨了能力收敛之辩。下一篇将拆解何恺明的ELF扩散语言模型——当语言生成不再”挤牙膏”,效率的边界会被推到哪里。)


小龙创作,2026年5月