中文

杂乱场景中语言条件抓取与放置的无条件动作先验高效对齐

机器人学 2025-09-09 v3 计算机视觉与模式识别

摘要

我们研究杂乱场景中的语言条件抓取与放置任务,其中机器人应在开放杂乱场景中抓取目标物体并将其移动到指定位置。一些方法利用视觉基础模型的特征学习端到端策略,需要大量数据。其他方法在零样本设置中组合基础模型,遭受级联误差的影响。此外,它们主要利用视觉和语言基础模型,对动作先验的关注较少。在本文中,我们旨在通过整合来自视觉、语言和动作的基础先验来开发有效的策略。我们提出A²,一种动作先验对齐方法,通过学习一个注意力层将无条件动作先验与3D视觉语言先验对齐。对齐公式使我们的策略能够以更少的数据进行训练,并保留零样本泛化能力。我们表明,共享的抓取与放置策略能提升每个任务的性能,并引入策略自适应方案以适应动作的多模态特性。大量仿真和真实世界实验表明,我们的策略在杂乱场景中以更少的步骤实现了更高的抓取与放置任务成功率,并能有效泛化到未见物体和语言指令。视频和代码可在 https://xukechun.github.io/papers/A2 获取。

关键词

引用

@article{arxiv.2503.09423,
  title  = {Efficient Alignment of Unconditioned Action Prior for Language-conditioned Pick and Place in Clutter},
  author = {Kechun Xu and Xunlong Xia and Kaixuan Wang and Yifei Yang and Yunxuan Mao and Bing Deng and Jieping Ye and Rong Xiong and Yue Wang},
  journal= {arXiv preprint arXiv:2503.09423},
  year   = {2025}
}

备注

Accepted by T-ASE and CoRL25 GenPriors Workshop