中文

ParticleFormer:用于多目标多材料机器人操作的3D点云世界模型

机器人学 2025-08-27 v4

摘要

3D世界模型(即基于学习的3D动力学模型)为通用机器人操作提供了可行的路径,通过捕捉环境演变相对于机器人动作的底层物理规律。然而,现有的3D世界模型主要局限于单材料动力学,使用基于粒子的图神经网络模型,往往需要耗时的3D场景重建来获取3D粒子轨迹用于训练。本文提出了ParticleFormer,一种基于Transformer的点云世界模型,通过混合点云重建损失进行训练,同时监督全局和局部动力学特征,适用于多材料、多对象机器人相互作用场景。ParticleFormer能够捕捉刚性、可变形和柔性材料之间细粒度的多对象相互作用,直接从真实世界机器人感知数据进行训练,无需复杂的场景重建。我们在3D场景预测任务和使用模型预测控制(MPC)策略的下游操作任务中展示了该模型的有效性。此外,我们将现有的动力学学习基准扩展以包含多样化的多材料、多对象交互场景。我们在六个仿真和三个真实实验中验证了该方法, consistently 以优于领先基线的方法,在动力学预测精度和下游视觉-运动任务中的滚动误差方面实现了显著优势。实验视频已公开:https://suninghuang19.github.io/particleformer_page/。

关键词

引用

@article{arxiv.2506.23126,
  title  = {ParticleFormer: A 3D Point Cloud World Model for Multi-Object, Multi-Material Robotic Manipulation},
  author = {Suning Huang and Qianzhong Chen and Xiaohan Zhang and Jiankai Sun and Mac Schwager},
  journal= {arXiv preprint arXiv:2506.23126},
  year   = {2025}
}