中文

通用人形机器人操作的循环几何先验多模态策略 RGMP

机器人学 2025-12-25 v2

摘要

人形机器人在执行多样化的人类水平技能方面展现出巨大潜力。然而当前研究主要依赖数据驱动方法,需大量训练数据以实现鲁棒的多模态决策能力和可泛化的视觉运动控制,这些方法因忽视不可见场景下的几何推理以及低效建模机器人-目标关系而浪费大量训练资源。为此,我们提出循环几何先验多模态策略 (RGMP),一个统一几何语义技能推理与数据高效视觉运动控制的端到端框架。对于感知能力,我们提出几何先验技能选择器,将几何归纳偏置注入视觉语言模型,产生针对未见场景的适应性技能序列,需最小空间常识调优。为实现数据高效的机器人运动合成,我们引入自适应递归高斯网络,将机器人-物体相互作用参数化为紧凑的高斯过程层级结构,递归编码多尺度空间关系,实现即使稀疏演示也能进行灵巧的数据高效运动合成。在我们的人形机器人和桌面双臂机器人上进行评估,RGMP 框架在泛化测试中实现了 87% 的任务成功率,数据效率比最新模型高出 5 倍。该性能彰显了其在几何语义推理和递归高斯适应下实现的卓越跨域泛化能力。

关键词

引用

@article{arxiv.2511.09141,
  title  = {RGMP: Recurrent Geometric-prior Multimodal Policy for Generalizable Humanoid Robot Manipulation},
  author = {Xuetao Li and Wenke Huang and Nengyuan Pan and Kaiyan Zhao and Songhua Yang and Yiming Wang and Mengde Li and Mang Ye and Jifeng Xuan and Miao Li},
  journal= {arXiv preprint arXiv:2511.09141},
  year   = {2025}
}