从”没人要”到120亿美元
副标题:华为AI芯片的逆袭,和正在断裂的CUDA护城河
2025年初,华为最先进的AI芯片遇到了一个尴尬的问题。
不是性能不行。不是产能不够。是——没人想用。
这颗叫Ascend 910C的芯片,硬件性能大约有英伟达H100的六成,在中国境内合法合规生产。但一个行业信源的评价非常直白:“910C的市场推广非常艰难。没有人想用。”
原因不在硬件。在软件。
英伟达的AI芯片之所以统治全球,不是因为它的晶体管比别人多——而是因为二十年来,全世界的AI开发者都在用一套叫CUDA的软件生态写代码。换芯片,就等于放弃这二十年积累的一切,从头来过。
(ps:设想一下,你用了十年Windows,所有的软件、文件、工作流都在上面。现在有人卖你一台电脑,硬件差不多,但只能跑一个你从没用过的操作系统——所有软件要重装,所有文件要转换格式,所有操作习惯要重新适应。你会买吗?这就是910C面对的局面。)
一年后。
2026年3月,华为新一代AI芯片Ascend 950PR进入量产。字节跳动——那个运营着TikTok全球推荐引擎、豆包日活过亿、CapCut AI编辑的中国最大AI用户——下单了。
56亿美元。约35万片芯片。
这是中国公司对国产AI芯片最大的一笔采购。不是象征性的”支持国产”,不是政府摊派的”任务指标”。是真金白银的商业决策。
从”没人要”到56亿美元订单,中间只隔了一年。
这一年里发生了什么?答案藏在CUDA护城河的裂缝里。
一、为什么910C卖不动?
先搞清楚一个前提:910C的硬件并不差。
两颗910B芯片封装在一起,SMIC 7nm工艺,单卡推理性能约为英伟达H100的60%。在以推理为主的中国AI市场,这个性能其实够用了。
但它有一个致命伤——开发者必须用华为自研的CANN框架,把所有CUDA代码从头重写一遍。
(ps:CUDA是什么?它是英伟达在2006年发布的一套并行计算平台。简单说,它让AI开发者可以用自己熟悉的编程语言直接操控GPU——不需要理解芯片内部是怎么工作的。二十年积累下来,全球AI领域几乎每一行代码、每一个工具、每一套优化方案都建立在CUDA之上。)
对于一家商业公司来说,把整个AI技术栈从CUDA迁移到CANN,意味着什么?
- 数十万到数百万行代码要重写
- 所有模型的推理和训练要重新优化
- 工程师要花数月甚至数年学习新框架
- 期间业务可能中断、性能可能下降、bug可能暴增
即使有政府推动国产替代的商业利好,这个成本也很难被任何以盈利为目的的企业接受。所以910C的局面是:政府想推,企业不接。
华为需要解决的不是”造出更快的芯片”。华为需要解决的是——怎么让换芯片的成本低于继续等英伟达的成本。
二、翻译层——950PR真正改变游戏的武器
2025年9月,华为首次公开了三年AI芯片路线图,其中包括一颗代号950PR的芯片。
2026年1月,样品送出。3月,量产启动。
在硬件层面,950PR相比910C的升级并不惊人——FP8算力1 PFLOPS,FP4算力2 PFLOPS。制程依然是7nm。但它有两个关键的改变:
第一,定位变了。 910C是一颗”什么都想做但什么都不精”的通用芯片。950PR被明确定位为推理芯片——专门优化运行已训练好的AI模型。而推理,恰恰是AI应用爆发后最大的计算需求。大模型训练是少数几家AI实验室的事,但推理是每一个接入了AI的应用都要做的事。
第二,也是决定性的——它有了一个CUDA翻译层。
华为把新一代软件框架命名为CANN Next。它里面内置了一层翻译机制——能自动把CUDA的API调用,映射到华为自己的硬件指令上。开发者不需要从头重写所有代码了。
(ps:翻译层的逻辑有点像——原来你要学一门全新的外语才能和对方交流。现在有个同声传译坐在你们中间。你说你的母语,翻译自动转换。虽然不是100%精确,但足以完成绝大多数日常对话。)
一位消息人士告诉路透社:“与910C相比,950PR的原始算力提升不大,但客户测试结果很好。芯片对NVIDIA的CUDA软件系统兼容性更好,响应速度更快。大科技公司计划更广泛地使用它。”
从”必须重写代码”到”大部分代码不用改”——这就是910C到950PR之间,华为完成的最重要的跨越。
三、三个最大的客户,三种不同的算盘
最先下单的是字节跳动。
$56亿——约等于35万片950PR。字节是中国最大的AI推理需求方:TikTok的推荐算法每天要处理数十亿次请求,豆包的日活用户过亿,CapCut的AI编辑功能被全球创作者使用。这些业务背后,是天文数字的推理算力。
(ps:字节不是会为”国产情怀”买单的公司。它是一家以极致效率著称的企业。$56亿这个数字说明了一件事——在字节自己的测试里,950PR已经可以满足主力业务的推理需求。)
接着是阿里巴巴和腾讯。
阿里的逻辑是”云”——阿里云是中国最大的公有云,它的AI算力租赁业务需要一个不会被供应中断打断的芯片来源。腾讯的逻辑是”应用”——微信、QQ、游戏、视频号,每一个超级App都在接入AI功能,推理算力缺口巨大。
三家加在一起,950PR的2026年订单已经超过100万片。华为今年AI芯片出货目标75万片——市场预期实际出货可能更多。全年AI芯片收入预计达到120亿美元,比2025年的75亿美元增长60%。
(ps:120亿美元是什么水平?大约是英伟达中国AI芯片巅峰收入的1/3。差距仍然巨大。但方向比绝对值重要——一年前是7.5亿,一年后是120亿,涨幅60%。这个增速,在任何一个行业都值得被认真对待。)
而三年前,华为在中国AI芯片市场的份额几乎为零。
四、DeepSeek——最不可能背书的人来了
2026年4月,中国最顶尖的AI模型公司DeepSeek发布了V4——一个1.6万亿参数的超大规模MoE模型。
V4的技术报告里写了一句从未出现过的话:
“我们在英伟达GPU和华为昇腾NPU两个平台上,均验证了细粒度专家并行方案。”
这是DeepSeek第一次在官方技术文档中,把华为昇腾和英伟达并列写入硬件验证清单。
更重要的信息藏在V4的API价格页的脚注里:
“若下半年昇腾950超节点批量上市,Pro版本的价格有下调空间。”
翻译一下:V4 Pro已经在华为芯片上跑通了。现在卡的不是技术,是华为芯片的供应量。一旦芯片到货,价格就能降。
这对于整个中国AI行业是一个强烈的信号。DeepSeek——中国最有影响力的开源AI模型公司——把它的核心模型跑在了国产芯片上。如果一个以技术极客文化著称的团队选择相信华为的硬件,其他公司还有什么理由不相信?
(ps:而且DeepSeek V4在华为芯片上的训练成本是多少?据估算约600万美元。同一时期美国前沿实验室训练同等规模模型的成本约1亿美元。差距不是”便宜一点”,是差了十几倍。这个差距里有一半来自算法效率,另一半来自——用华为芯片你不用付英伟达的溢价。)
五、护城河的崩塌,比想象中更快
黄仁勋在2026年5月21日的CNBC专访中,说了三句意味深长的话。
第一句:“我们基本放弃了中国的AI芯片市场。”
从95%到接近零。不是主动放弃,是被放弃。
第二句:“华为非常、非常强大。他们度过了创纪录的一年。在我们缺席的情况下,他们在蓬勃发展,现在正在把技术出口到全球,与美国公司竞争。”
承认对手的成功——这话从一个常年稳居全球AI芯片第一名的人嘴里说出来,分量不同。
第三句——最值得细品的一句:
“放弃中国这么大的市场,可能不太合理。我认为这在很大程度上已经适得其反了。”
“适得其反”——黄仁勋用的英文是”backfired”。这个词在英文里的原意是”枪炸膛”——你开了一枪,子弹没打出去,枪管反而炸了,伤了自己。
他说的”适得其反”,指的是什么?
出口管制的初衷是限制中国的AI能力。但结果是什么?中国AI芯片从几乎为零增长到2025年占国内市场的41%,华为AI芯片年收入从零到120亿美元只用了三年。而且——最关键的是——中国开发者在被迫离开CUDA之后,在CANN上建立了一套全新的工作流。
(ps:这就像你本来用惯了微信,突然有一天微信在中国被禁了。你被迫用了一个新软件。刚开始很痛苦。但用了一年之后,你的所有联系人、聊天记录、支付方式、小程序都在新软件上了。这时候微信突然说”没事了,可以回来用了”。你会回去吗?大概率不会。因为迁移回去的成本太大了。)
这就是CUDA护城河真正的裂缝所在。 它不是一个技术问题——是人的问题。几十万中国AI工程师花了两年时间,习惯了在CANN上写代码、调参数、做优化。这个”习惯”一旦形成,切换回去的成本远大于留在CANN上的成本。
软件生态的锁定,从来不是单向的。CUDA可以锁住人,CANN也可以。关键是谁先锁住谁。
六、从跟随到并行——这条路还很长
说完了逆袭故事,需要补充一个冷静的注脚。
华为目前最先进的AI芯片,用的是SMIC的7nm工艺——而英伟达最新一代Blackwell用的是TSMC的4nm。制程差距决定了单卡性能的上限。950PR的FP4性能大约是H20的2.8倍——但H20本身就是一款被出口管制刻意削弱过的芯片。
功耗差距也很明显:950PR功耗600W,H20是400W——高出50%。数据中心的运营成本需要考虑电力账单。
在全球市场,英伟达仍然占据80-90%的AI芯片份额。英伟达2026年Q1营收816亿美元,同比增长85%——中国市场归零丝毫没有影响它的全球增长。华为的120亿美元与之相比,只是一小杯。
但故事的关键不在于今天谁大谁小。而在于方向。
| 维度 | 2024年 | 2025年 | 2026年(预测) |
|---|---|---|---|
| 华为AI芯片收入 | — | $7.5B | $12B |
| 国产AI芯片中国份额 | — | 41% | 50-60% |
| 英伟达中国AI芯片份额 | ~66% | ~55% | 接近0% |
| 大客户态度 | 观望/拒绝 | 小量试用 | 大规模下单 |
方向是明确的。速度是惊人的。华为接下来的路线图——960(2027,翻倍算力)、970(2028,再翻倍)、990(2030,逻辑折叠)——如果能如期推进,性能差距会进一步缩小。
更根本的是:中国AI芯片产业的逻辑变了。
从”我们尽量做得和英伟达一样好”变成了”我们的客户已经在上面跑了两年核心业务,数百万行代码积淀在上面,工具链、工作流、人才都在上面——为什么要回去?“
结尾:锁的尽头,是另一把锁
2026年5月,黄仁勋在CNBC上说”适得其反”的时候,表情里有一种罕见的无奈。
他知道发生了什么。他比任何人都清楚,二十年前他发布CUDA的时候,业界根本没人看好——为什么要在硬件上绑定一套软件?这不是”增加摩擦”吗?
但正是这套别人看不上的软件生态,在AI时代成为全世界最深的护城河。二十年来,没有任何一个竞争对手攻破了它。
直到2026年。
攻破的方式不是造出更快的芯片,而是造出了一个让开发者不需要重写代码就能迁移的翻译层。 千里之堤,毁于蚁穴。这个”蚁穴”,就是那层看似不起眼的软件翻译机制。
这个故事最妙的地方在于——
黄仁勋用CUDA证明了软件生态是最坚固的锁。
华为用CANN Next证明了,任何一把锁,只要使用者被关在外面足够久,他们就会自己配一把新的。
而当他们配好了新锁——
你就算把旧锁打开,也没人会往回走了。
龙鹰镖局出品 中美博弈大变局,百年未有新财富