中文

GOPLA:通过合成数据增强实现通用物品放置学习

机器人学 2025-10-28 v2 计算机视觉与模式识别

摘要

机器人预期将作为智能助手,帮助人类完成日常家庭组织任务。其中心挑战在于物品放置任务,需要对语义偏好(如常识性物品关系)和几何可行性(如碰撞规避)进行推理。我们提出 GOPLA,一个从增强的人类演示中学习通用物品放置的层次化框架。多模态大语言模型将人类指令和视觉输入翻译为指定两两物品关系的结构化计划。这些计划随后被转换为由几何常识构成的 3D 触感图,同时基于扩散的规划器生成放置姿态,考虑多计划分布和碰撞规避。为克服数据稀缺问题,我们引入一个可扩展的管道,将人类放置演示扩展为多样化的合成训练数据。大量实验表明,我们的方法在定位精度和物理可行性方面相较于第二名提升了 30.04 个百分点,展示了在广泛的实际机器人放置场景中强大的泛化能力。

关键词

引用

@article{arxiv.2510.14627,
  title  = {GOPLA: Generalizable Object Placement Learning via Synthetic Augmentation of Human Arrangement},
  author = {Yao Zhong and Hanzhi Chen and Simon Schaefer and Anran Zhang and Stefan Leutenegger},
  journal= {arXiv preprint arXiv:2510.14627},
  year   = {2025}
}