梁文锋:不跟随的人
龙鹰镖局 | 中国人工智能领军人物系列 第8期
中美博弈大变局,百年未有新财富
2025年12月8日,英国《自然》杂志发布年度十大科学人物榜单。
一个中国名字出现在了这份全球最权威的科学人物名单中。Nature给他的评语是四个字:“科技颠覆者”(Tech disruptor)。
更有趣的是,Nature在文章中透露了一个细节——这位颠覆者”拒绝了我们(Nature)的采访请求”。编辑无奈地调侃:“他的模型开放程度与他本人的神秘程度不相上下。”
这个人叫梁文锋。DeepSeek创始人。一个来自广东吴川农村、父母都是小学老师的85后。
一年前,他发布的DeepSeek-R1模型让英伟达一天之内蒸发了近6000亿美元市值。硅谷同行送了他一个绰号:“来自东方的神秘力量”。
一个有趣的对比是:如果你问DeepSeek的AI”梁文锋是谁”,它会告诉你——“没有关于梁文锋背景的公开信息”。连他自己造出来的AI,都不知道他的底细。
但如果你读过他在两次深度专访中说的每一句话——2023年5月和2024年7月,他分别接受了36氪旗下”暗涌Waves”的专访——你会发现这个人的故事其实异常清晰。
他的一生,就是一个持续”不跟随”的过程。
一、2002年:拒绝”赚快钱”的一代人
1985年,梁文锋出生在广东省湛江市吴川市覃巴镇米历岭村。
父母都是小学语文老师。在这个粤西农村,九十年代正是”广东赚钱”的黄金时代。梁文锋后来回忆:“当时有不少家长觉得读书没用。”
但他父亲教给他的是另一种东西。
村里人记得这个孩子从小数学就好,初中就开始自学微积分。每次数学考试稳居年级前三。2002年,17岁的梁文锋以吴川一中”高考状元”、湛江地区第一名的成绩考入浙江大学电子信息工程专业。
一个农村孩子,靠着最”笨”的方式——读书——走出了广东农村。
(ps: 这个细节值得注意。梁文锋后来在采访中说过一句话:“我是八十年代在广东一个五线城市长大的。九十年代,广东赚钱机会很多……但现在回去看,观念都变了。因为钱不好赚了,连开出租车的机会可能都没了。一代人的时间就变了。“这段话的精髓在于——他从小就在观察一个时代命题:什么才是能穿越周期的能力?读书是,赚快钱不是。)
2010年硕士毕业时,他的选择又一次”不跟随”。
同学们纷纷进入大厂做程序员——那是中国互联网最黄金的年代,阿里刚完成18亿美元融资,腾讯市值逼近400亿美元。但梁文锋没有。
他去了成都,住进一间廉价出租屋。
接下来三年,他反复把AI算法应用到各种场景里——失败了就换一个方向,再失败再换。一个浙大硕士,在出租屋里做着一个当时几乎没人看得懂的事情。
多年后有人问他为什么。他说的是:“当时我们尝试了很多场景,最终切入了足够复杂的金融。通用人工智能可能是下一个最难的事之一。所以对我们来说,这是一个怎么做的问题,而不是为什么做的问题。”
一个人选择最难的路径,往往不是因为他比别人勇敢——而是因为他觉得简单的路径”不够有意思”。
这就是梁文锋的底层逻辑。他不是一个典型的”创业者”,他是一个解题者。哪里有最难的题,他就往哪里去。
二、2015-2021年:做量化,但”不跟随”华尔街
2013年,梁文锋和浙大同学徐进创立雅克比投资。2015年,幻方量化正式成立。
在外界看来,这是一个典型的”量化天才”故事——数学好、编程强、在金融市场赚大钱。但如果只看到这一层,就完全错过了重点。
幻方量化从一开始就和华尔街的量化基金不一样。
2016年10月,幻方推出了第一个AI模型,首笔由深度学习生成的交易仓位上线。在此之前,幻方团队的算法主要依赖线性模型和传统机器学习,计算主要依靠CPU。但从这一天起,梁文锋开始大量使用GPU。
这比ChatGPT引爆AI浪潮早了整整六年。
2019年,幻方管理规模突破百亿。大多数量化私募在这个阶段的选择是什么?扩大募资、招更多基金经理、把规模继续做大。
梁文锋做了什么?
他花2亿元自建了一个叫”萤火一号”的深度学习训练平台,搭载了1100块GPU。2021年,又砸10亿元建”萤火二号”,搭载了约10000张英伟达A100 GPU——在美国政府随后出台芯片禁令之前,这批GPU已经到手。
一个有远见的人,不是在看到未来之后行动——而是在别人都看不见未来的时候,就已经在建造迎接未来的基础设施了。
“萤火”这个名字,后来变成了一个隐喻。在黑暗里发出自己的光,不等待别人的灯塔。
(ps: 2021年幻方在建设萤火二号时,大部分业内人士对这个决策的评价是”看不懂”。那时大模型还不是显学,ChatGPT还要两年才面世。但梁文锋事后说:“当2020年OpenAI发布GPT3后,方向很清楚,需要大量算力;但即便2021年,我们投入建设萤火二号时,大部分人还是无法理解。“——被大多数人看不懂,往往是你做对了的信号。)
三、2023年:一个”最不声不响”的入局者
2023年4月11日,幻方发布了一则公告,正式宣布进军通用人工智能。公告末尾,引用了法国新浪潮导演特吕弗的一句名言:
“务必要疯狂地怀抱雄心,且还要疯狂地真诚。”
2023年7月,DeepSeek正式成立。
当时中国的”百模大战”已经白热化。百度、阿里、腾讯、字节、智谱、月之暗面……几乎所有有头有脸的科技公司都在做大模型。每一家都在拼命融资,拼命宣传,拼命抢应用场景。
DeepSeek选择了什么?
- 不融资。梁文锋拒绝了陈天桥(对谈四小时后婉拒),拒绝了联想创投,拒绝了无数试图挤进来的VC。
- 不做应用。“我们的目标很明确,就是不做垂类和应用,而是做研究,做探索。”
- 不做PR。梁文锋极少公开露面。团队规模仅139人(OpenAI有1200人)。
- 不依赖海归。“V2模型没有海外回来的人,都是本土的。前50名顶尖人才可能不在中国,但也许我们能自己打造这样的人。”
- 全面开源。当所有中国大厂都在闭源或半闭源时,DeepSeek把最好的模型免费公开。
五个”不跟随”的选择,每一个都是在跟整个行业的共识对着干。
有人会问:这不就是”非主流”吗?非主流不等于正确。
是的,非主流不等于正确。但当一个人连续做了五个非主流的选择,而每一个选择都在事后被证明是对的——那这就不是”非主流”,这是**“比别人更早看到主流应该往哪里走”**。
四、2024-2025年:不跟随的人如何颠覆世界
让我们用几个数字来看梁文锋的”不跟随”带来了什么。
2024年5月,DeepSeek-V2发布。
推理成本:每百万token仅1元——约等于Llama3 70B的七分之一,GPT-4 Turbo的七十分之一。
怎么做到的?梁文锋团队独创了MLA(多头潜在注意力机制)架构,把显存占用降到了传统MHA架构的5%-13%。又独创了DeepSeekMoESparse结构,把计算量压缩到极致。
整个中国大模型行业的价格战,是被一个只有139人的小公司引爆的。 字节、阿里、百度、腾讯纷纷跟进降价,最高降幅达97%。
梁文锋后来说了句很”凡尔赛”但极其真诚的话:
“我们不是有意成为一条鲶鱼,只是不小心成了一条鲶鱼。”
“我们降价,只是顺手而为。我们的目标还是实现AGI。”
(ps: 这句话是理解梁文锋的关键。他不是在搞什么”价格战策略”——价格战是商业语言,而他的语言是”研究语言”。对一个研究者来说,降低成本的动力不是市场策略,而是”用更少的资源做出更强的能力”本身就是一个好问题。)
2024年12月27日,DeepSeek-V3发布。
训练成本:557.6万美元。仅使用2048块算力稍弱的英伟达H800 GPU。而OpenAI的GPT-4o,训练成本高达7800万至1亿美元。
以十分之一的成本,做出足以与GPT-4o较量的水平。
2025年1月20日,DeepSeek-R1发布。
全球首个开源推理大模型,性能比肩OpenAI o1。同一天,梁文锋出现在了一个特殊的场合:中南海——他作为AI领域的代表,参加了国务院总理李强主持的专家企业家座谈会。
7天后,全球资本市场给出了反应:英伟达单日市值蒸发近6000亿美元。这是美股历史上最大的单日市值蒸发之一。
硅谷的同行们给DeepSeek起了一个名字:“来自东方的神秘力量”。
但梁文锋自己对这个标签的回应极其冷静:
“在美国每天发生的大量创新里,这是非常普通的一个。他们之所以惊讶,是因为这是一个中国公司,在以创新贡献者的身份,加入到他们游戏里去。毕竟大部分中国公司习惯follow,而不是创新。”
这句话说出了整个中国AI产业最深的痛——也是梁文锋最想打破的魔咒。
五、他的”不跟随”到底意味着什么?
要理解梁文锋,就要理解他反复强调的一个概念:“原创和模仿的差距”。
他说:“我们经常说中国AI和美国有一两年差距,但真实的gap是原创和模仿之差。如果这个不改变,中国永远只能是追随者。”
他说:“过去三十多年IT浪潮里,我们基本没有参与到真正的技术创新里。我们已经习惯摩尔定律从天而降,躺在家里18个月就会出来更好的硬件和软件。但其实,这是西方主导的技术社区一代代孜孜不倦创造出来的,只因为之前我们没有参与这个过程,以至于忽视了它的存在。”
他说:“随着经济发展,中国也要逐步成为贡献者,而不是一直搭便车。”
这些话,如果换一个人来说,你会觉得是”宏大叙事”。但从梁文锋嘴里说出来,分量完全不一样——因为他是用行动在说。
他用557万美元证明了”不用烧千亿美元也能做前沿AI”。他用139人团队证明了”不用海归也能做出世界级模型”。他用全面开源证明了”不闭源也能保持竞争力”。他用三年不融资证明了”不被资本绑架也能活下去”。
他每打破一个”行业共识”,就为中国AI的原创之路多铺了一块砖。
有人会问:既然如此,为什么2026年4月他又开始融资了?目标估值100亿美元——后来一路飙到450亿,甚至500亿美元。这不就是”打脸”吗?
这个问题问得很好——但答案可能比你想的更有意思。
六、2026年:当”不跟随”需要升级
2025年底到2026年初,DeepSeek经历了一个艰难的阶段。
人才流失。 R1核心研究员郭达雅去了字节(传闻年薪近亿),V3核心作者罗福莉被雷军挖到小米,第一代大模型核心王炳宣去了腾讯……至少5名核心研发人员离职。在AI行业”人才即一切”的铁律下,每一个核心研究员的离开都意味着一整条技术线的停摆。
产品节奏。 DeepSeek已有15个月没有大版本更新。原计划2026年2月发布的V4一拖再拖,竞争对手OpenAI和Anthropic已经进入了”月更模式”。
基础设施。 2026年3月29日,DeepSeek宕机近12小时,登上热搜。模型再强,服务器不稳,用户体验就是零。
而最致命的问题是期权。
DeepSeek从成立至今从未接受外部融资,员工手中的期权完全依赖内部估值。没有外部机构以真金白银确认价格之前,这种”纸面财富”在顶级AI人才眼中缺乏流通性和吸引力。当字节开出近亿年包、腾讯给出明确期权定价的时候,DeepSeek的期权就是一张无法兑现的期票。
所以,梁文锋启动了融资。
但这个融资,和他”不跟随”的哲学矛盾吗?
不。因为梁文锋做了一件在创投史上极其罕见的事——他自己出资200亿元,占了本轮融资总额500亿元的40%。
一个创始人,在公司估值暴涨的节点,自掏腰包为公司估值托底。这不是被动妥协,这是主动掌控。
融资的深层逻辑不是”缺钱”——幻方量化2025年平均收益率高达56.6%,给梁文锋个人带来的收入超过7亿美元。DeepSeek根本不缺钱。
融资的真正目的是:给期权定价。给人才信心。给商业化铺路。让”不跟随”的组织有继续不跟随的底气。
(ps: 这就像一个人练了十年内功,终于出山比武。出山不等于放弃了内功——出山是把内功用在更大的战场上。梁文锋的不融资、不商业化,建立了一家世界上最纯粹的技术研究公司。现在他需要融资和商业化,是为了让这家公司能继续做纯粹的研究——而不是被竞争对手用钱把人才挖空。)
七、时代注脚:解题的人
从1994到2026,中国AI走过了三十二年。
这三十多年里,绝大多数时候,中国公司的角色都是四个字:跟随、应用。用别人的技术,做自己的变现。这个模式赚了很多钱,但也留下了一个巨大的空白——原创的空白。
2024年,36氪在DeepSeek-V2爆火之后采访梁文锋,记者问了一个尖锐的问题:经济下行、资本进入冷周期,对原创式创新是否起抑制作用?
梁文锋的回答出乎意料:
“未必。中国产业结构的调整,会更依赖硬核技术的创新。当很多人发现过去赚快钱很可能来自时代运气,就会更愿意俯身去做真正的创新。”
这段话,是这个系列八期以来,关于”中美博弈大变局”最精准的一个时代判断。
中美AI竞争,最终比的不是谁的模型更大、谁的烧钱更多——而是谁能在有限的资源下,走出一条原创的路。
梁文锋证明了一件事:原创不是美国人的专利。一个广东农村走出来的男孩,靠着自己和一群应届毕业生,用557万美元,做出了让硅谷颤抖的模型。
但他也证明了另一件事:原创是一条极其艰难的路。 它需要你在所有人都跟随的时候选择不跟随,在所有人都赚钱的时候选择不赚快钱,在所有人都说”做应用吧”的时候坚持做研究,在所有人都拥抱资本的时候拒绝融资——然后,在时机到了的时候,又能够足够清醒地转身,用市场化的方式把原创的路继续走下去。
2023年,梁文锋说过一句话:
“务必要疯狂地怀抱雄心,且还要疯狂地真诚。”
2024年他又说了另一句话:
“以后硬核创新会越来越多,因为整个社会群体需要被事实教育。当这个社会让硬核创新的人功成名就,群体性想法就会改变。我们只是还需要一堆事实和一个过程。”
2025年,他自己成为了那个”事实”。
结语:萤火
梁文锋给自己的超级计算机取名叫”萤火”。
萤火是一种在黑暗中自己发光的东西。它不等待太阳,不借用月亮。它用自己的能量,发出虽然微弱但确实存在的光。
第一次造萤火的时候(2019年),投入2亿元。 第二次造萤火的时候(2021年),投入10亿元。 第三次——当他决定以”不跟随”的姿态进军AGI的时候——投入的是全部。
一个广东农村的孩子,一路上做了那么多”不跟随”的选择,最后成为了一个让全球科技界不得不追随的”颠覆者”。
这就是萤火的意义。
它不需要照亮整个世界。它只需要让后来的人知道:这里有一条路。有人走过。可以走。
“中国AI不可能永远处在跟随的位置。有些探索,是逃不掉的。” ——梁文锋,DeepSeek创始人
本文为龙鹰镖局原创,第8期「中国人工智能领军人物」系列。下一期:杨植麟 —— 摇滚青年的AGI长征。