
大模型进化:文本、图片、视频、3D世界——尽头还是起点?
核心问题:多模态大模型的发展有没有终点?如果有,终点在哪里?
2026年的春天,大模型赛道正在发生一场静悄悄的革命。
当所有人还在讨论ChatGPT的代际更新时,一些更敏锐的人已经把目光投向了更远的地方:文本、图片、视频之后,大模型的下一个方向是什么?3D虚拟世界会是终点吗?
这个问题的重要性在于:如果我们能看清大模型进化的方向,就能判断当前的投资热潮究竟是泡沫还是革命的前夜。
多模态大模型不会止步于某一模态,但每一次跨越都会经历”技术先行、商业验证”的阵痛期。 今天这篇文章,我们从数据出发,试着回答这个问题。
一、进化史:效率提升不等于商业成功
回顾大模型的多模态进化史,有一个规律反复出现:技术突破先于商业验证。
文本时代(2020-2025):GPT-3点燃了市场,但真正让大模型进入主流的是ChatGPT。核心驱动力不是模型本身更强,而是交互界面的革命——把AI能力包装成普通用户能理解、能使用的产品形态。
图片时代(2022-2026):Midjourney和Stable Diffusion展示了AI生成图像的惊人能力。但仔细看数据:Midjourney年营收2023年约2亿美元,背后是大量设计从业者和小B商家,真正的C端付费用户反而是少数。图片生成的最大受益者是设计工具厂商(如Adobe),而非AI原生企业。
视频时代(2024-2026验证期):OpenAI Sora上线5天下载量突破100万——看起来不错。但2026年,Sora关停了,生命周期总收入仅约210万美元。真正的问题不是”没有技术代差”,而是”经济模型不可持续”:Sora单日推理成本高达1500万美元,月收入却只有数十万美元。 技术上能跑通,不等于商业上能跑通。
反观快手的Kling和字节的Seedance,定位完全不同:不做C端炫技,做B端降本增效。嵌入广告制作、漫剧生产、影视工业辅助等真实生产场景,每分钟AI视频成本约300美元(高端定制服务定价),远低于传统制作成本。快手2025年财报专门提到AI视频对广告收入的”关键贡献”。
这个规律值得所有AI从业者和投资人记住:技术炫酷 ≠ 商业成功。真正成功的AI产品,核心不是”我能做到什么”,而是”解决了什么真实问题”。
二、视频生成的困境:Sora失败了,然后呢?
Sora的失败不是意外,而是技术理想主义撞上了经济现实。
问题一:经济模型不可持续
这是最核心的问题。Sora的日推理成本高达1500万美元,而其生命周期总收入仅约210万美元。这个数字背后的含义是:即便Sora技术上有一定可用性,其单位经济模型也无解。
问题二:缺乏专业场景可控性
Sora能生成视频,但生成的内容不可控——无法保证生成一只奔跑的狗而不是一只变形的怪物。在专业场景,这意味着Sora只能做”Demo展示”,无法真正嵌入工作流。
更关键的是:操作零门槛 ≠ 生产力零门槛。用户能生成视频,不等于能生成有用的视频。
问题三:没有变现闭环
Sora用户生成视频后,发到哪里?给谁看?怎么赚钱?这些问题都没有答案。没有”创作→发布→变现”的闭环,用户的创作动力就是无根之水。
抖音+剪映为什么能成功?答案很简单:因为它们解决了一整套问题——从创作(模板化工具降低门槛)到发布(平台分发)到变现(广告分成/直播带货)。AI视频生成只是工具,但工具不能脱离系统而存在。
问题四:版权风险
迪士尼曾谈判百亿美元授权但破裂,直接揭示了一个问题:用现有影视IP训练视频生成模型,法律上是一片雷区。
视频AI竞争格局:谁在活下来?
Sora关停后,Google Veo成为最大受益者——原生4K/60fps能力,YouTube生态支撑,月活已超1100万。美国市场形成了Veo(Google)+ Runway Gen-4.5的二元格局。中国市场则是快手Kling与字节Seedance的竞争,两者都在B端找到了降本增效的落地场景。
三、3D虚拟世界:大模型的下一个前沿
如果我们把视频生成看作”2D内容的AI化”,那3D虚拟世界就是”整个空间感知的AI化”。这不只是维度的提升,而是质的跃变。
为什么3D世界更难?
物理世界的复杂性远超2D内容:
- 空间关系:物体之间的相对位置、遮挡关系、力学特性
- 因果关系:推一个物体它会倒下,但以什么角度、什么力度倒下?
- 交互反馈:在虚拟世界走路,脚踩在地面的感觉是什么?
Roblox的探索
Roblox是全球最大的UGC游戏社交平台,拥有1.515亿DAU(2025Q3),同比增长70%。它的Cube3D系统支持文本直接生成可互动3D物体,将复杂建模简化为自然语言交互。
但Roblox的逻辑不是”用AI替代创作者”,而是”用AI降低创作门槛”:
- 普通用户用自然语言描述想要的世界
- AI生成基础3D结构
- 用户在此基础上修改、创造
这个模式的关键在于:AI是创作的放大器,而不是创作的终结者。
高德(阿里)的具身智能路线
更具代表性的是高德的”途途”四足机器人导盲项目。
导盲是具身智能最严苛的验证场景:人突然停下、自行车斜穿、盲道被占——所有变量不会提前打招呼,一旦失误可能危及用户安全。
高德的ABot技术架构分为三层:
- ABot-World:可交互世界模型,接近物理世界的训练环境
- ABot-N0/M0:导航基座模型+操作执行模型
- ABot-Claw:操作系统层,串联意图理解、空间记忆、任务拆解、执行监控
核心技术概念叫”Map as Memory”:先给机器人一张持续存在的世界底图,把视觉、感知、动作嵌进这张底图。机器人在空间中移动,本质上是在更新和调用这张底图。
硬件平台的角色
3D虚拟世界的落地,离不开硬件平台的支撑。苹果Vision Pro正在推进空间计算生态,Meta Quest以MR路线切入消费级市场。这些硬件平台与3D世界模型相互赋能:硬件提供感知能力(摄像头、传感器),软件提供理解能力(世界模型),两者结合才能构建真正的沉浸式体验。
四、世界模型:大模型的尽头还是起点?
如果说3D虚拟世界是”空间的多模态化”,那”世界模型(World Model)“就是”物理世界规律的多模态化”。
什么是世界模型?
简单说:AI不仅能生成内容,还能理解物理世界的运行规律。
比如:在真实物理世界中,扔一个球,它会落地弹起,这个规律不会因为球的颜色或大小而改变。世界模型要做的,就是让AI理解这些不变规律,并能在虚拟环境中应用这些规律。
为什么这可能是大模型的”尽头”?
如果大模型能完美理解并模拟物理世界,那么:
- 可以用虚拟世界预测真实世界的变化(天气预报、科学实验)
- 可以训练机器人在虚拟环境中获得真实世界的能力(机器人训练)
- 可以构建沉浸式的虚拟生活空间(元宇宙的真正形态)
为什么这可能只是”起点”?
理解了物理世界后,大模型还可以做什么?
答案是:理解之后,还可以改造。
当AI能精确模拟物理世界,它就能预测特定干预的结果——这意味着AI可以参与真实世界的设计、规划、优化。从这个角度看,多模态大模型没有尽头,只有不断拓展的边界。
一个补充视角:中国市场的独特规律
值得注意的是,这篇文章讨论的规律主要基于美国市场。中国市场有其独特之处:
- 百度、阿里、字节等平台自带场景和分发渠道,AI落地速度更快
- DeepSeek-V3用557万美元完成了与GPT-4数亿美元相当的训练,资本效率是中国路线的比较优势
- 但监管对内容生成AI的约束也比美国更紧
五、核心结论
多模态大模型的尽头在哪里?它没有尽头。它只有不断延伸的地平线。
答案一:技术没有尽头
从文本到图片到视频到3D世界,每一次模态拓展都打开了新的可能性。当我们站在2026年回望过去,会发现当初担心的”AI瓶颈”大多是错的——不是技术到了尽头,而是我们的想象力到了尽头。
答案二:商业化有阶段
每一代技术都有其”商业化时间窗”:
- 文本:2020-2025年,ChatGPT引爆,交互界面革命
- 图片:2022-2026年,Adobe等工具厂商整合AI
- 视频:2024-2026年为验证期,多数C端项目已淘汰,B端降本增效存活
- 3D/世界模型:2025-2030年,具身智能+虚拟世界同步推进
答案三:判断标准始终一致
无论技术如何演进,判断一个AI方向的价值的三个问题始终有效:
- 经济模型可持续吗?→ 日推理成本 vs 潜在收入
- 有清晰的付费方吗? → B端 > C端
- 有变现闭环吗? → 创作→发布→赚钱
一个对投资者的额外忠告
判断”谁受益”往往比判断”哪个应用会赢”更容易。即便判断错了具体哪个应用会成功,只要AI投资不退潮,基础设施层(GPU云、推理芯片、Agent开发框架)必然受益。这是比押注应用层更稳定的投资逻辑。
附:关键数据汇总
| 指标 | 数据 | 来源 |
|---|---|---|
| Roblox DAU | 1.515亿(2025Q3),+70% | RBLX财报 |
| DeepSeek-V3训练成本 | 278.8万小时H800算力 | 官方技术报告 |
| Sora上线5天下载量 | 100万+ | Bill Peebles推特 |
| Sora日推理成本 | ~1500万美元/天 | 行业估算 |
| Sora生命周期总收入 | ~210万美元 | 行业估算 |
| AI视频每分钟成本 | ~300美元(高端定制) | 行业数据 |
| 中国AI推理Token CAGR | 330%(2025-2030) | 摩根大通 |
| 高德(阿里)具身智能 | ABot-World+Map as Memory | 晚点LatePost(2026-04-19) |
| Google Veo月活 | 超1100万 | 行业数据 |
| Midjourney年营收 | 约2亿美元(2023年) | David Holz确认 |
本文由小龙创作,商分老王、投资老钟联合审校