近日,大晓机器人携手南洋理工大学S-Lab等机构,共同推出并开源了统一多模态世界模型框架Puffin-World。这一创新成果聚焦于空间智能与具身智能领域,首次在一个统一框架内,将物理、几何和外观定义为三维世界的三种原生状态,并整合了重力场感知、自由视点空间仿真、三维世界生成与重建以及闭环探索等功能,能够精准预测机器人行动后的世界状态。
Puffin-World不仅开源了代码和模型,还发布了Puffin-16M数据集。该数据集包含1500万组视觉—语言—相机三元组和100万条具有挑战性的旋转轨迹,同时开放了覆盖28个公开数据集、约4450万张图像的绝对相机位姿标注。这一举措为机器人仿真、合成数据生产以及具身智能训练提供了可复现、可扩展的技术支撑。
对于机器人训练而言,关键并非视觉逼真的视频,而是能够支撑感知、定位、规划和行动的环境信息,如相机姿态、重力方向稳定性、场景结构延续性以及机器人移动后的视觉变化。图像仅是世界状态的一部分,物理方向、空间几何和视觉外观共同构成了机器人训练所需的环境。
Puffin-World从三维世界状态出发,将其建模为物理、几何和外观三种相互关联的原生状态。物理状态描述相机和观测视角在真实世界中的绝对朝向,包括重力场与纬度图;几何状态通过深度信息表达场景的三维结构、空间远近和表面关系;外观状态则对应相机最终观察到的RGB图像。这三种状态共同构建了从“世界如何存在”到“世界如何被交互”的完整表达。在生成新视角时,模型不仅要呈现画面内容,还要确保画面在物理方向和三维结构上的合理性。
Puffin-World在一个模型中实现了四类任务的统一,这些任务过去通常需要不同系统分别完成。其一,单图理解相机物理信息。输入一张图片,模型能够结合地平线、垂直结构和场景构图进行空间推理,预测相机相对于真实物理世界的横滚角、俯仰角和垂直视场角,并生成场景语义描述,不仅识别图中内容,还理解当前视角的姿态。其二,自由视点空间仿真。用户可明确指定相机方向和视场角,模型据此生成符合目标机位的画面,使文生图从内容控制迈向精确的空间控制。其三,三维世界生成与重建。模型可以从文字、单张图像或少量参考图像出发,按照指定相机轨迹生成多个新视角,并同步预测每个视角的外观和深度,最终汇聚为具有一致空间结构的三维世界。其四,闭环自校准探索。当相机姿态偏离重力方向时,模型先感知当前物理状态,再推理修正动作,并生成动作执行后的目标观察,形成“状态感知—动作预测—结果生成—再次校准”的闭环,高效扮演World Action Model (WAM)角色。技术报告还展示了其模仿式世界探索能力,即从同一初始视角出发,按照给定相机轨迹扩展并探索新的三维世界。
目前,Puffin-World的统一能力已在四项Benchmark中取得领先成绩。在相机到真实世界理解任务上,该模型在Stanford2D3D、MegaDepth、TartanAir和LaMAR四个公开基准上取得最佳或并列最佳的中位误差,并在大多数AUC指标上领先。
世界模型对复杂空间的理解能力,很大程度上取决于训练数据是否同时具备视觉内容、场景语义、绝对相机信息和多样化运动。Puffin-16M数据集正是基于这一需求构建,包含Puffin-Cam-15M和Puffin-Traj-1M两部分。Puffin-Cam-15M提供1500万组视觉—语言—相机三元组,覆盖室内、室外、真实和合成等多种场景,包含不同分辨率、宽高比、相机姿态和视场角,不仅告知模型图像内容,还说明图像的相机观测条件。Puffin-Traj-1M则提供100万条具有挑战性的旋转轨迹,覆盖连续俯仰、横滚、偏航、复合运动以及360度环视等复杂情况,弥补了传统三维数据集在大幅旋转和长轨迹探索方面的不足。与主要描述视角相对变化的数据不同,Puffin-16M进一步引入相机相对于重力和真实世界的绝对方向,使模型不仅学习“相机从上一帧移动了多少”,还要理解“相机当前在世界中处于什么方向”。
除自建数据集外,团队还利用Puffin-World精准的物理世界感知能力,为28个公开数据集补充了绝对相机位姿标注,覆盖约4450万张图片,包括ImageNet、CC12M、Objects365、ScanNet、DL3DV和GPIC等。标注内容包括横滚角、俯仰角和视场角,可用于研究不同视觉数据中的机位偏差,也可为相机条件生成、物理世界理解和空间智能训练提供大规模监督。











