李飞飞的世界模型是什么——从Atlas的发布说起,它可能改变什么?
(来源:金科之家网)
2026年9月1日,斯坦福大学教授李飞飞联合创立的World Labs发布了新一代世界模型Atlas。官方给它的定义是“面向空间智能的全能世界模型”,也是他们口中的“全球首个多模态世界模型”。
这不是李飞飞第一次提出“世界模型”这个概念。2025年11月,她发表了一篇题为《从文字到世界:空间智能是人工智能的下一个前沿领域》的长文,系统阐述了空间智能的理论框架。
2026年6月,她又和团队发表了《世界模型的功能分类:渲染器、模拟器、规划器,以及连接它们的循环》,试图厘清当时市面上对“世界模型”这个概念的混乱使用。
这篇文章试图把李飞飞的世界模型说清楚:它是什么,怎么工作的,对哪些行业可能有影响。
一、什么是世界模型
世界模型不是某一个具体产品,而是一类AI系统的统称。李飞飞的定义是:能够理解、推理并交互于语义、物理、几何及动态维度上的复杂世界(包括真实与虚拟环境)的生成模型。
说得直白一点:大语言模型(Large Language Model,LLM)处理的是文字,视频生成模型处理的是像素,而世界模型处理的是空间本身——物体的位置、形状、距离、空间关系,以及这些关系随时间的变化。
李飞飞在2026年6月的一篇文章中,把市面上各种被称为“世界模型”的系统分成了三类:
1.渲染器
输出的是人类能看的像素画面。目前主流的AI视频生成模型基本都属于这一类——输入文字,输出视频。它们擅长让画面“看起来真实”,但不一定理解画面背后的物理逻辑。
2.模拟器
输出的是状态数据——几何、物理、动力学层面的信息,而不只是画面。对于工程师来说,这意味着可以进行计算和验证;对于机器人来说,意味着可以在虚拟环境中训练。
3.规划器
输出的是行动——下一步该做什么。对于机器人,是向前走、向左转还是伸手抓取;对于自动驾驶系统,是何时刹车、何时变道。
李飞飞自己的判断是:渲染器商业化最成熟但有天花板(好看不等于物理正确),规划器最令人兴奋但离真实部署最远,模拟器是被严重低估的关键枢纽。
Atlas属于哪一类?从技术上看,它同时覆盖了渲染器和模拟器的功能——既能生成画面,又能重建空间结构。World Labs接下来的目标是补上动态、编辑和交互能力,让模型不只是生成世界,还能理解世界怎样响应动作。
二、Atlas具体能做什么
Atlas的核心能力可以用一个词概括:新视角预测。
大语言模型预测的是下一个词元(token),视频模型预测的是下一帧画面,Atlas预测的是从另一个位置看过去会是什么样。
具体来说,Atlas有三项基本能力:
1.生成
输入一张图像和一条相机运动轨迹,模型可以沿着指定的视角生成视频帧。
2.重建
输入一帧或多帧现实世界的图像(最多100帧),模型可以从这些不同视角重建出三维空间——既可以生成穿行于这个空间的视频,也可以输出显式的3D重建结果。
3.模拟
利用重建或生成的空间进行仿真。
官方演示中有一个例子:拍摄一个人投篮,或者一颗草莓落进一碗牛奶——只需要三台iPhone,分别架在三脚架上拍摄。
过去拍这种“子弹时间”效果,需要把数百台相机围成一圈。Atlas拿到三段视频后,可以重新设计镜头路径:比如把时间冻结,让相机在牛奶溅起的瞬间飞进场景。
从技术架构上看,Atlas被描述为一种“多模态自回归扩散Transformer”。这个名称包含四层含义:
多模态:可以原生处理文本、图像、相机位姿和三维深度图。
自回归:按序列逐步生成,每一步参考此前已输入和已生成的内容。
扩散生成:采用整流流模型逐步去除噪声生成数据。
Transformer:模型计算可转化为适合现代加速硬件的大规模矩阵运算。
Atlas与普通视频生成模型最本质的区别在于:相机几何信息不再是“向左移动镜头”这类文字的间接描述,而是成为模型的原生输入。
用户可以指定相机的位置、姿态与运动路径,模型据此生成新视角画面,最高可输出一分钟、1440p的视频。
不过需要说明的是,以上关于“像素级相机控制”“重建效果优于专用模型”等结论,目前主要来自World Labs自身的演示与内部评测,尚未有独立的第三方验证结果。
三、世界模型可能用在哪些地方
从目前公开的信息来看,世界模型可能影响的领域主要有以下几个。
1.影视与虚拟制作
Atlas可以用少量相机拍出传统需要数百台相机才能完成的镜头效果。这对影视预演、虚拟制片意味着什么,不难想象。Marble(World Labs于2025年11月发布的商用世界模型平台)已覆盖视觉特效和虚拟制片场景。
2.建筑与工业设计
Marble已覆盖建筑与室内设计可视化场景。Atlas可以把真实环境搬进数字空间。但一个重要的提醒是:由单张或少量照片推断出的三维结构,不能直接当作测量结果使用,必须与激光扫描、CAD模型或现场实测进行交叉验证。
3.机器人训练
这是李飞飞本人最看重的方向之一。她在访谈中说,机器人眼下最大的瓶颈是数据而非芯片。真实世界中采集机器人训练数据成本高、速度慢、场景有限。Atlas可以把真实环境更快搬进仿真世界,再通过随机化生成大量训练场景。
2026年7月,World Labs发布了名为R2S2R(Real-to-Sim-to-Real,真实-仿真-真机)的闭环框架。
这个框架的工作方式是:从真实世界采集数据构建高保真仿真环境,在仿真中大规模训练策略,再将训练好的模型部署回真实世界。同月,World Labs收购了机器人仿真公司SceniX。
4.游戏开发与3D资产生成
Marble已覆盖游戏开发资产生成与下载集成场景。Atlas的3D重建和生成能力在这个领域也有直接的应用价值。
5.其他领域
Marble还被提到可以用于心理与临床研究的沉浸式实验环境。
四、行业格局:三条路线在竞争
Atlas发布的时间点不是孤立的。
2026年9月1日,Anthropic推出Claude Fable 5.1,同一天World Labs发布Atlas。
9月3日,OpenAI发布GPT-6 Astra。据媒体报道,字节跳动也在研发实时空间视频生成模型。
这三条技术路线有所不同:
1.OpenAI和Anthropic走的是大语言模型路线
靠LLM的推理和工具调用能力,操作Blender、Unreal Engine等专业软件来生成3D内容。
2.字节跳动的Seedance代表视频模型路线
3.World Labs走的是原生世界模型路线
从零训练一个理解三维空间的世界模型,在底层表征层面就做出空间一致性。
三条路线起点不同,但指向同一个方向:可进入、可交互的三维空间。
五、需要注意的几个事实
1.Atlas目前仍处于面向少数合作伙伴的早期访问阶段
World Labs尚未公开完整的模型参数、训练数据、推理成本、接口规范及第三方测试结果。
2.世界模型这个概念本身还在发展中
李飞飞自己在2026年6月的文章中就指出,当时市面上对“世界模型”的使用存在混乱。不同公司、不同研究团队说的“世界模型”,可能指的是完全不同的东西。
3.从概念到工业级部署还有距离
Atlas目前更应被视作一个值得跟踪的技术方向,而非一款已经成熟的产品。李飞飞自己说,世界模型现在的位置大概相当于2019年的语言模型。
4.生成内容可能带来识别难题
有分析指出,Atlas这类世界模型生成的视频,在后续编辑过程中,水印可能被破坏,导致人眼和检测器双重识别失效。
六、关于World Labs这家公司
World Labs成立于2024年初,2024年9月正式亮相。公司在2024年完成超过2.3亿美元融资,估值超过10亿美元。
2026年2月,World Labs宣布完成新一轮10亿美元融资。投资方包括英伟达(Nvidia)、AMD、欧特克(Autodesk)、Emerson Collective、富达管理研究公司等。其中Autodesk单家投资2亿美元。融资后公司估值达到50亿美元。
World Labs总部位于旧金山。
七、小结
李飞飞的世界模型,简单来说就是让AI理解三维空间的一套技术路线。Atlas是目前这条路线上的最新成果——一个能同时做生成、重建和模拟的多模态模型。
它对行业的意义可能体现在几个层面:降低3D内容创作的门槛、为机器人训练提供更高效的仿真环境、推动AI从处理文字和像素走向理解物理空间。
但也要看到,这项技术目前仍处于早期阶段,从演示到大规模商用还有相当的距离。关于它的能力、成本和可靠性,目前主要信息来自World Labs自身,独立验证尚不充分。
免责声明:自媒体内容仅用于记录和分享,请勿用于商业用途。所有内容来自于网络,或由人工智能服务生成。如有文字或图片涉及侵权,请联系修改或删除。文章内容不代表本人观点,亦不代表本人所在机构观点,不构成任何投资建议。