AI 空间智能:世界模型如何理解物理世界
2026 年 9 月 1 日,World Labs 发布了新一代世界模型 Atlas。两天后我读完它的技术博客,又回头翻了一遍 Sora、Genie、Cosmos 这几条线的公开资料,想回答一个问题:这些被称为「世界模型」(world model)的生成式系统,到底在多大程度上理解了物理世界。
先把核心判断放在开头:空间智能(spatial intelligence)是目标,世界模型是实现目标的技术手段;真正在发生的事,是模型从「生成看起来对的像素」走向「理解并维持 3D 一致的空间状态」。 李飞飞(Fei-Fei Li)2024 年在 TED 演讲里把目标说成「AI 理解真实世界」,当时她还只有概念和团队;两年后的 Atlas 把手段交了出来:一个原生处理文本、图像、视频与三维数据的模型。
四个词,先分清
空间智能、世界模型、3D 理解、直觉物理,这四个词常被混用,所指并不相同:
| 术语 | 含义 | 补充 |
|---|---|---|
| 空间智能(spatial intelligence) | AI 对三维世界感知、推理、预测并交互的能力 | 目标性概念,李飞飞提出 |
| 世界模型(world model) | 能对环境生成、重建、仿真的模型 | 技术形态,学术源头是 Ha & Schmidhuber 2018 的「梦中学习」 |
| 3D 理解 / 重建 | 从稀疏图像恢复场景几何,输出点云、网格等 | 技术路线:NeRF(2020)到 3D Gaussian Splatting(2023) |
| 直觉物理(intuitive physics) | 对运动、碰撞、遮挡的本能预测 | 有 IntPhys 一类基准在衡量 |
它们的关系:空间智能是愿景,世界模型是载体,3D 理解与直觉物理是载体要具备的两种能力。区别在于:3D 理解回答「空间长什么样」(静态几何),直觉物理回答「接下来会发生什么」(时序因果),世界模型要把两者合起来,还要求能生成、能交互。
这里有个常见的误区:视频生成不等于世界模型。 OpenAI 2024 年 2 月发布 Sora 时,技术报告的标题就是「作为世界模拟器的视频生成模型」,但那是愿景表达。能生成逼真的视频,不代表模型内部维持了一个真实的 3D 状态——这恰恰是后来所有争论的起点。
一条主线:从像素到空间状态
把 2024 年以来的进展排开,可以看到一条清晰的演进线:
| 阶段 | 代表 | 核心思想 | 局限 |
|---|---|---|---|
| 2D 视频生成 | Sora(2024) | 大规模 diffusion transformer 生成视频,自称世界模拟器 | 无显式 3D 状态,一致性靠涌现 |
| 3D 重建 | NeRF → 3DGS | 从多视角恢复可渲染场景 | 密集视图要求,重建不等于生成 |
| 可交互世界 | Genie 系列(2024–2025) | 视频 token + latent action,单图生成可玩世界 | 输出仍是 2D 像素 |
| 物理 AI 仿真 | Cosmos(2025–2026) | 面向机器人与自动驾驶的世界基础模型 | 偏特定下游 |
| 全能世界模型 | Atlas(2026) | 空间上下文 + 原生相机位姿,生成与重建统一 | 成本与规模化待观察 |
几个机制转折值得单独说明。一是 token 化:图像与视频被切成 token 才能进入 Transformer 的自回归序列,视频在多数新模型里就是「图像序列」。二是 latent action(潜在动作):Genie 不预设动作空间,而是从视频里自动学出可操作的维度,让模型可被实时操控。三是自回归与扩散的合流:用自回归的方式决定「下一步生成什么」,用扩散去噪决定「这一步画成什么样」。四是从点云到 3D Gaussian splats 的显式表示,让「输出 3D」有了可渲染、可在设备端运行的载体。
Atlas:把 3D 位置变成原生输入
Atlas 是这条主线目前的终点形态。先看它官方博客里的关键定义:
一个 omni model(全能模型),从零预训练,原生处理文本、图像、视频与 3D。 架构是多模态自回归扩散 Transformer(multimodal autoregressive diffusion transformer),用整流流(rectified flow)去噪生成。官方博客明确写了它是「built to scale」:预训练了多档规模的模型,算力增加会解锁新能力。
它区别于此前世界模型的创新,官方称为 spatial context(空间上下文):类比大语言模型的上下文,但其中每个输入图像都被锚定在三维空间的一个明确位置(由相机位姿 camera pose 给出)。模型基于这个上下文生成「接下来」,与已见内容保持 3D 一致,同时想象未见的部分。相机位姿因此成了原生输入类型,而不是文本里的一句「镜头左移」。官方演示里有个例子很能说明问题:把两张毫无关系的参考图放进空间上下文并分别定位,模型能生成一个在两图之间平滑过渡的世界,自己想象出门廊、走廊这些衔接物。
Atlas 的四大能力,全部来自官方博客:
| 能力 | 输入 | 输出与规格 |
|---|---|---|
| 相机控制生成 | 1–6 张参考图 + 手工设计的相机路径 | 最长 1 分钟、1440p 视频,像素级相机跟随 |
| 空间重建 | 稀疏视角图(官方称 2–3 张即可忠实重建,上下文中可放进上百张) | 新视角图像 + 显式 3D(点云、3D Gaussian splats) |
| 时空仿真 | 输入视频 | reframing(子弹时间式镜头变换),面向机器人的 Real-to-Sim 工作流 |
| 图像生成 | 文本 | 文生图、360 全景 |
官方公布了两组硬性基准。3D 重建一项在 DTU、ETH3D、KITTI 等 7 个数据集上以统一口径复算所有基线,Atlas 平均点图误差 8.6,五个近期专用重建模型分布在 9.7–18.2。相机控制生成采用第三方人工评测:给定同一张图,其他模型只能用文本描述镜头运动,Atlas 用原生相机格式,结果偏好 Atlas 的比例为 75%–94%(对照 MiniMax H3、Gemini Omni Flash、Happy Horse 1.1、FLUX 3、Seedance 2.5)。这套评测的设定本身就说明了分野:相机控制这件事,文本描述与原生位姿不是同一量级的输入。
商业化方面,官方称 Atlas 将驱动其 3D 场景产品 Marble 的未来版本,模型本身进入 early access 阶段。
全景:玩家与路线分野
把主要玩家放进一张表,各自的赌注一目了然:
| 玩家 | 代表成果 | 定位 |
|---|---|---|
| World Labs | Atlas(2026-09) | 空间智能产品:生成 + 重建 + 仿真 |
| Google DeepMind | Genie → Genie 2 → Genie 3 | 可交互世界模型 |
| NVIDIA | Cosmos 系列 | 物理 AI(机器人/自动驾驶)的世界基础模型 |
| OpenAI | Sora | 「世界模拟器」愿景 |
| Meta | WorldGen | 文本生成可探索的 3D 世界(据报道) |
| 初创 | Odyssey、Decart(Oasis) | 实时生成交互世界 |
玩家之间的分野,可以用两列来速查:模型是否把显式 3D 当作输出或要维护的状态,相机位姿是否作为原生输入类型。
| 玩家 | 输出显式 3D | 相机位姿原生输入 |
|---|---|---|
| World Labs(Atlas) | 是:点云 / 3D Gaussian splats | 是 |
| DeepMind(Genie 3) | 否:实时像素世界 | 否:操控维度靠 latent action 学出 |
| OpenAI(Sora) | 否:2D 视频 | 否:镜头运动靠文本描述 |
| NVIDIA(Cosmos) | 未见官方主打 | 未见官方主打 |
DeepMind 的 Genie 线最有连续性:Genie(2024)证明单张图能生成可玩世界,Genie 2(2024 年底)加入长时间记忆与实时交互;Genie 3(2025)更进一步:官方博客描述为「给定文本提示词,生成可在其中实时导航的动态世界,24 帧每秒、720p、一致性保持数分钟」。但三代的输出始终是像素世界,官方从未声称维护显式 3D 状态——这是它与 Atlas 最根本的分野。
NVIDIA 的 Cosmos 走另一条路:官方把它定义为「世界基础模型」(world foundation model),把视觉推理、多模态生成与动作预测揉在一起,为机器人和自动驾驶提供「行动前先思考」的仿真能力,Cosmos 3 是其中的开放版本。它服务于物理 AI 的训练数据需求,而非面向创作者的 3D 场景。Odyssey 与 Decart 则代表实时性这一极:前者流式生成 3D 交互世界,后者实时生成可玩的 Minecraft 式世界,把延迟压到人能直接上手玩的程度。
应用的想象与边界
不同技术取向对应不同落点:
| 场景 | 怎么用 | 对应玩家 |
|---|---|---|
| 机器人 / 具身智能 | Real-to-Sim:几段手机视频重建空间,生成机器人视角观测用于训练 | Atlas、Cosmos |
| 游戏 | 实时生成可玩、可导航的世界 | Genie 3、Decart |
| 影视 / VFX | 相机路径级导演控制、reframing、长镜头 | Atlas |
| 自动驾驶 | 大规模可控仿真场景,让系统在虚拟环境里先练 | Cosmos |
| AR / VR | 文本生成可进入探索的 3D 世界 | Meta WorldGen |
边界同样清晰。几何一致性仍是公开难题:长序列里场景结构会漂移、出现穿帮,Atlas 用空间上下文缓解但未宣称解决。持久性(persistence)是学界新近盯上的问题:物体离开视野再回来,状态是否保持——ICML 2026 的一篇论文标题直言需要「持久的 3D 状态」而非「像素历史」。可交互性与离线生成之间存在张力:实时操控往往要牺牲分辨率与保真度。可控性依赖原生输入:纯文本驱动的模型做不了精细相机控制。成本方面,1 分钟 1440p 的生成与大规模 3D 重建的推理开销,官方至今没有公布。
懂物理,还是像物理
围绕世界模型的争论,落在同一个问题:这些系统是理解了物理,还是拟合了像素?
正方以 LeCun 为代表。他的路线与上述所有生成式玩家都不同:与其在像素空间逐帧预测,不如在表示空间(representation space)预测世界状态的变化,避开「逐像素生成」的成本与无关细节。2025 年 11 月,LeCun 与 Balestriero 发表了 LeJEPA,把 JEPA(联合嵌入预测架构)从蓝图落到可证明、可扩展的自监督训练目标,论文摘要开宗明义:学习世界及其动力学的可操作表征,是 AI 的中心问题。
反方来自一批批评文献。NeurIPS 2025 观点论文《Learning Intuitive Physics Requires More Than Visual Data》主张:只靠视觉观察学不到真正的直觉物理,模型需要更多结构化信息;《The Observer Effect in World Models》则指出世界模型在适配环境时可能污染自身学到的潜在物理。更一般的批评是:逼真生成可以是像素层面的统计关联,分布外(out-of-distribution)场景下会失效。
我的处理是摆事实,不替读者下结论。看 Atlas 公布的基准:重建误差和相机路径跟随,全部是「几何与视角」指标,没有任何一项测「场景中的物理是否真实」——抛一个球,它落地是否合规律,目前不在任何官方基准里。显式 3D 与原生相机位姿把「空间结构」变成了模型要维护的显式状态,这是实质进步;但维护 3D 状态离理解物理还有一段距离,这段距离有多远,是接下来最值得观察的事。
参考
- World Labs — Atlas: A World Model for Spatial Intelligence
- Fei-Fei Li — TED 2024: With spatial intelligence, AI will understand the real world
- OpenAI — Video generation models as world simulators
- Google DeepMind — Genie 3: A new frontier for world models
- Google DeepMind — Genie 2: A large-scale foundation world model
- Genie 论文(arXiv 2402.15391)
- NVIDIA — How Cosmos 3 Helps Physical AI Think Before It Acts
- Ha & Schmidhuber — Recurrent World Models Facilitate Policy Evolution
- Balestriero & LeCun — LeJEPA(arXiv 2511.08544)
- Learning Intuitive Physics Requires More Than Visual Data(NeurIPS 2025)
- The Observer Effect in World Models
- Beyond Pixel Histories: World Models with Persistent 3D State(ICML 2026)
- Meta WorldGen 报道(Creative Bloq)
- Odyssey 报道(TechCrunch)
- Decart Oasis(deeplearning.ai)