从”没人要”到120亿美元

副标题:华为AI芯片的逆袭,和正在断裂的CUDA护城河


2025年初,华为最先进的AI芯片遇到了一个尴尬的问题。

不是性能不行。不是产能不够。是——没人想用。

这颗叫Ascend 910C的芯片,硬件性能大约有英伟达H100的六成,在中国境内合法合规生产。但一个行业信源的评价非常直白:“910C的市场推广非常艰难。没有人想用。”

原因不在硬件。在软件。

英伟达的AI芯片之所以统治全球,不是因为它的晶体管比别人多——而是因为二十年来,全世界的AI开发者都在用一套叫CUDA的软件生态写代码。换芯片,就等于放弃这二十年积累的一切,从头来过。

(ps:设想一下,你用了十年Windows,所有的软件、文件、工作流都在上面。现在有人卖你一台电脑,硬件差不多,但只能跑一个你从没用过的操作系统——所有软件要重装,所有文件要转换格式,所有操作习惯要重新适应。你会买吗?这就是910C面对的局面。)

一年后。

2026年3月,华为新一代AI芯片Ascend 950PR进入量产。字节跳动——那个运营着TikTok全球推荐引擎、豆包日活过亿、CapCut AI编辑的中国最大AI用户——下单了。

56亿美元。约35万片芯片。

这是中国公司对国产AI芯片最大的一笔采购。不是象征性的”支持国产”,不是政府摊派的”任务指标”。是真金白银的商业决策。

从”没人要”到56亿美元订单,中间只隔了一年。

这一年里发生了什么?答案藏在CUDA护城河的裂缝里。


一、为什么910C卖不动?

先搞清楚一个前提:910C的硬件并不差。

两颗910B芯片封装在一起,SMIC 7nm工艺,单卡推理性能约为英伟达H100的60%。在以推理为主的中国AI市场,这个性能其实够用了。

但它有一个致命伤——开发者必须用华为自研的CANN框架,把所有CUDA代码从头重写一遍。

(ps:CUDA是什么?它是英伟达在2006年发布的一套并行计算平台。简单说,它让AI开发者可以用自己熟悉的编程语言直接操控GPU——不需要理解芯片内部是怎么工作的。二十年积累下来,全球AI领域几乎每一行代码、每一个工具、每一套优化方案都建立在CUDA之上。)

对于一家商业公司来说,把整个AI技术栈从CUDA迁移到CANN,意味着什么?

  • 数十万到数百万行代码要重写
  • 所有模型的推理和训练要重新优化
  • 工程师要花数月甚至数年学习新框架
  • 期间业务可能中断、性能可能下降、bug可能暴增

即使有政府推动国产替代的商业利好,这个成本也很难被任何以盈利为目的的企业接受。所以910C的局面是:政府想推,企业不接。

华为需要解决的不是”造出更快的芯片”。华为需要解决的是——怎么让换芯片的成本低于继续等英伟达的成本。


二、翻译层——950PR真正改变游戏的武器

2025年9月,华为首次公开了三年AI芯片路线图,其中包括一颗代号950PR的芯片。

2026年1月,样品送出。3月,量产启动。

在硬件层面,950PR相比910C的升级并不惊人——FP8算力1 PFLOPS,FP4算力2 PFLOPS。制程依然是7nm。但它有两个关键的改变:

第一,定位变了。 910C是一颗”什么都想做但什么都不精”的通用芯片。950PR被明确定位为推理芯片——专门优化运行已训练好的AI模型。而推理,恰恰是AI应用爆发后最大的计算需求。大模型训练是少数几家AI实验室的事,但推理是每一个接入了AI的应用都要做的事。

第二,也是决定性的——它有了一个CUDA翻译层。

华为把新一代软件框架命名为CANN Next。它里面内置了一层翻译机制——能自动把CUDA的API调用,映射到华为自己的硬件指令上。开发者不需要从头重写所有代码了。

(ps:翻译层的逻辑有点像——原来你要学一门全新的外语才能和对方交流。现在有个同声传译坐在你们中间。你说你的母语,翻译自动转换。虽然不是100%精确,但足以完成绝大多数日常对话。)

一位消息人士告诉路透社:“与910C相比,950PR的原始算力提升不大,但客户测试结果很好。芯片对NVIDIA的CUDA软件系统兼容性更好,响应速度更快。大科技公司计划更广泛地使用它。”

从”必须重写代码”到”大部分代码不用改”——这就是910C到950PR之间,华为完成的最重要的跨越。


三、三个最大的客户,三种不同的算盘

最先下单的是字节跳动。

$56亿——约等于35万片950PR。字节是中国最大的AI推理需求方:TikTok的推荐算法每天要处理数十亿次请求,豆包的日活用户过亿,CapCut的AI编辑功能被全球创作者使用。这些业务背后,是天文数字的推理算力。

(ps:字节不是会为”国产情怀”买单的公司。它是一家以极致效率著称的企业。$56亿这个数字说明了一件事——在字节自己的测试里,950PR已经可以满足主力业务的推理需求。)

接着是阿里巴巴和腾讯。

阿里的逻辑是”云”——阿里云是中国最大的公有云,它的AI算力租赁业务需要一个不会被供应中断打断的芯片来源。腾讯的逻辑是”应用”——微信、QQ、游戏、视频号,每一个超级App都在接入AI功能,推理算力缺口巨大。

三家加在一起,950PR的2026年订单已经超过100万片。华为今年AI芯片出货目标75万片——市场预期实际出货可能更多。全年AI芯片收入预计达到120亿美元,比2025年的75亿美元增长60%。

(ps:120亿美元是什么水平?大约是英伟达中国AI芯片巅峰收入的1/3。差距仍然巨大。但方向比绝对值重要——一年前是7.5亿,一年后是120亿,涨幅60%。这个增速,在任何一个行业都值得被认真对待。)

而三年前,华为在中国AI芯片市场的份额几乎为零。


四、DeepSeek——最不可能背书的人来了

2026年4月,中国最顶尖的AI模型公司DeepSeek发布了V4——一个1.6万亿参数的超大规模MoE模型。

V4的技术报告里写了一句从未出现过的话:

“我们在英伟达GPU和华为昇腾NPU两个平台上,均验证了细粒度专家并行方案。”

这是DeepSeek第一次在官方技术文档中,把华为昇腾和英伟达并列写入硬件验证清单

更重要的信息藏在V4的API价格页的脚注里:

“若下半年昇腾950超节点批量上市,Pro版本的价格有下调空间。”

翻译一下:V4 Pro已经在华为芯片上跑通了。现在卡的不是技术,是华为芯片的供应量。一旦芯片到货,价格就能降。

这对于整个中国AI行业是一个强烈的信号。DeepSeek——中国最有影响力的开源AI模型公司——把它的核心模型跑在了国产芯片上。如果一个以技术极客文化著称的团队选择相信华为的硬件,其他公司还有什么理由不相信?

(ps:而且DeepSeek V4在华为芯片上的训练成本是多少?据估算约600万美元。同一时期美国前沿实验室训练同等规模模型的成本约1亿美元。差距不是”便宜一点”,是差了十几倍。这个差距里有一半来自算法效率,另一半来自——用华为芯片你不用付英伟达的溢价。)


五、护城河的崩塌,比想象中更快

黄仁勋在2026年5月21日的CNBC专访中,说了三句意味深长的话。

第一句:“我们基本放弃了中国的AI芯片市场。”

从95%到接近零。不是主动放弃,是被放弃。

第二句:“华为非常、非常强大。他们度过了创纪录的一年。在我们缺席的情况下,他们在蓬勃发展,现在正在把技术出口到全球,与美国公司竞争。”

承认对手的成功——这话从一个常年稳居全球AI芯片第一名的人嘴里说出来,分量不同。

第三句——最值得细品的一句:

“放弃中国这么大的市场,可能不太合理。我认为这在很大程度上已经适得其反了。”

“适得其反”——黄仁勋用的英文是”backfired”。这个词在英文里的原意是”枪炸膛”——你开了一枪,子弹没打出去,枪管反而炸了,伤了自己。

他说的”适得其反”,指的是什么?

出口管制的初衷是限制中国的AI能力。但结果是什么?中国AI芯片从几乎为零增长到2025年占国内市场的41%,华为AI芯片年收入从零到120亿美元只用了三年。而且——最关键的是——中国开发者在被迫离开CUDA之后,在CANN上建立了一套全新的工作流。

(ps:这就像你本来用惯了微信,突然有一天微信在中国被禁了。你被迫用了一个新软件。刚开始很痛苦。但用了一年之后,你的所有联系人、聊天记录、支付方式、小程序都在新软件上了。这时候微信突然说”没事了,可以回来用了”。你会回去吗?大概率不会。因为迁移回去的成本太大了。)

这就是CUDA护城河真正的裂缝所在。 它不是一个技术问题——是人的问题。几十万中国AI工程师花了两年时间,习惯了在CANN上写代码、调参数、做优化。这个”习惯”一旦形成,切换回去的成本远大于留在CANN上的成本。

软件生态的锁定,从来不是单向的。CUDA可以锁住人,CANN也可以。关键是谁先锁住谁。


六、从跟随到并行——这条路还很长

说完了逆袭故事,需要补充一个冷静的注脚。

华为目前最先进的AI芯片,用的是SMIC的7nm工艺——而英伟达最新一代Blackwell用的是TSMC的4nm。制程差距决定了单卡性能的上限。950PR的FP4性能大约是H20的2.8倍——但H20本身就是一款被出口管制刻意削弱过的芯片。

功耗差距也很明显:950PR功耗600W,H20是400W——高出50%。数据中心的运营成本需要考虑电力账单。

在全球市场,英伟达仍然占据80-90%的AI芯片份额。英伟达2026年Q1营收816亿美元,同比增长85%——中国市场归零丝毫没有影响它的全球增长。华为的120亿美元与之相比,只是一小杯。

但故事的关键不在于今天谁大谁小。而在于方向

维度2024年2025年2026年(预测)
华为AI芯片收入$7.5B$12B
国产AI芯片中国份额41%50-60%
英伟达中国AI芯片份额~66%~55%接近0%
大客户态度观望/拒绝小量试用大规模下单

方向是明确的。速度是惊人的。华为接下来的路线图——960(2027,翻倍算力)、970(2028,再翻倍)、990(2030,逻辑折叠)——如果能如期推进,性能差距会进一步缩小。

更根本的是:中国AI芯片产业的逻辑变了。

从”我们尽量做得和英伟达一样好”变成了”我们的客户已经在上面跑了两年核心业务,数百万行代码积淀在上面,工具链、工作流、人才都在上面——为什么要回去?“


结尾:锁的尽头,是另一把锁

2026年5月,黄仁勋在CNBC上说”适得其反”的时候,表情里有一种罕见的无奈。

他知道发生了什么。他比任何人都清楚,二十年前他发布CUDA的时候,业界根本没人看好——为什么要在硬件上绑定一套软件?这不是”增加摩擦”吗?

但正是这套别人看不上的软件生态,在AI时代成为全世界最深的护城河。二十年来,没有任何一个竞争对手攻破了它。

直到2026年。

攻破的方式不是造出更快的芯片,而是造出了一个让开发者不需要重写代码就能迁移的翻译层。 千里之堤,毁于蚁穴。这个”蚁穴”,就是那层看似不起眼的软件翻译机制。

这个故事最妙的地方在于——

黄仁勋用CUDA证明了软件生态是最坚固的锁。

华为用CANN Next证明了,任何一把锁,只要使用者被关在外面足够久,他们就会自己配一把新的。

而当他们配好了新锁——

你就算把旧锁打开,也没人会往回走了。


龙鹰镖局出品 中美博弈大变局,百年未有新财富