李飞飞发布多模态世界模型Atlas 打通机器人“Real-to-Sim”关键路径
曹乐琪 (Lucky Cao)
曹乐琪 (Lucky Cao)

2026-09-02

李飞飞发布多模态世界模型Atlas 打通机器人“Real-to-Sim”关键路径

李飞飞联合创立的World Labs发布全球首个多模态世界模型Atlas,能从单张照片生成一致性3D世界,为机器人与视觉特效铺路。

9月1日,由斯坦福大学教授李飞飞联合创立的World Labs发布新一代世界模型Atlas。该模型被官方称为全球首个多模态世界模型,能够以像素级精度控制生成图像与视频,并完成三维空间重建与时空模拟。

Fei-Fei Li发布原文

全能架构融合多模态数据

Atlas是一个从零预训练的多模态自回归扩散Transformer,可原生处理文本、图像、视频、相机位姿与3D深度图。其核心创新在于将所有输入锚定在三维空间,形成统一的“空间上下文”,再根据该上下文生成后续内容,从而保证三维空间一致性。

四大核心能力覆盖生成、重建与模拟

Atlas具备相机控制生成能力:仅需1至6张参考图及预设相机路径,即可生成最高1440p分辨率、长达1分钟的视频,用户可精确控制镜头角度与运动轨迹。在空间重建方面,Atlas可从2至3张普通照片忠实还原真实场景,并输出点云或3D高斯泼溅等显式几何数据,在DTU等公开基准上表现优于专业3D重建模型。

系统模拟测试(图片来源:WorldLabs)

Atlas还支持时空模拟,能从手机拍摄的普通视频中重建三维场景,并生成机器人仿真所需的RGB图像与深度数据,为机器人“Real-to-Sim”训练提供了低成本、可规模化的新路径。此外,它也可根据文本生成图像与360度全景图。

瞄准机器人仿真与创意产业

李飞飞此前将世界模型分为渲染器、模拟器与规划器,并强调模拟器是让AI理解物理世界的基础。Atlas正是这一理念的落地,其定位是为机器人、视觉特效、游戏开发等场景提供可直接集成的空间智能基座模型。

World Labs表示,Atlas将用于未来版本的3D世界生成产品Marble,目前已向部分合作伙伴开放早期访问。该发布正值空间智能从研究走向商业化之际,公司近期营收增长与收购机器人仿真公司SceniX的动作,均显示其在该赛道上的战略布局正在加速。