PointWorld:规模化的三维世界模型用于野外机器人操作
机器人学
2026-01-08 v1 人工智能
计算机视觉与模式识别
摘要
人类能够仅凭一眼观察和对身体动作的思考,预判三维世界将如何作出响应,这一能力对机器人操作同样至关重要。我们介绍了 PointWorld,一个大规模预训练的三维世界模型,将状态和动作统一地表示为共享三维空间中的三维点流:给定一到几个 RGB-D 图像和一序列低层次机器人动作命令,PointWorld 会预测每个像素在三维空间中的位移,以响应给定的动作。通过将动作表示为三维点流而非特定于身体姿态的动作空间(例如关节位置),该表述能够直接依赖于机器人的物理几何图形,同时无缝集成跨身体姿态的学习。为了训练我们的三维世界模型,我们构建了一个大规模数据集,涵盖真实和模拟的机器人操作场景,基于最近在三维视觉和模拟环境方面的进展,总计约 200 万条轨迹和 500 小时的单臂 Franka 机器人和双臂人形机器人的训练数据。通过对 backbone 结构、动作表示、学习目标、部分可见性、数据混合、域迁移和规模化等方面的严格、大规模实证研究,我们提炼出大规模三维世界建模的设计原则。PointWorld 实现了实时(0.1 秒)推理速度,可高效集成到操作控制的模型预测控制(MPC)框架中。我们展示,一个预训练的单一检查点即可使真实世界中的 Franka 机器人执行刚体推送、可变形和关节物体操作以及工具使用,无需任何演示或后训练,仅凭一张野外捕获的单张图像即可实现。项目网站为 https://point-world.github.io/。
引用
@article{arxiv.2601.03782,
title = {PointWorld: Scaling 3D World Models for In-The-Wild Robotic Manipulation},
author = {Wenlong Huang and Yu-Wei Chao and Arsalan Mousavian and Ming-Yu Liu and Dieter Fox and Kaichun Mo and Li Fei-Fei},
journal= {arXiv preprint arXiv:2601.03782},
year = {2026}
}