中文

Ag2Manip:基于智能体无关视觉与动作表征学习新型操作技能

机器人学 2024-04-29 v1 计算机视觉与模式识别

摘要

能够学习新型操作任务的自主机器人系统有望变革从制造业到服务自动化的各个行业。然而,现代方法(如VIP和R3M)仍面临重大障碍,特别是机器人具身之间的领域差距以及特定动作空间内成功任务执行的稀疏性,导致任务表征错位且模糊。我们提出Ag2Manip(用于操作任务的智能体无关表征),该框架通过两项关键创新来克服这些挑战:一种新颖的智能体无关视觉表征,源自人类操作视频,通过模糊具身细节来增强泛化能力;以及一种智能体无关动作表征,将机器人的运动学抽象为通用智能体代理,强调末端执行器与物体之间的关键交互。Ag2Manip在FrankaKitchen、ManiSkill和PartManip等模拟基准上的实证验证显示,性能提升了325%,且无需领域特定的演示。消融研究强调了视觉和动作表征对这一成功的关键贡献。将评估扩展到现实世界后,Ag2Manip将模仿学习成功率从50%显著提升至77.5%,证明了其在模拟和物理环境中的有效性和泛化能力。

关键词

引用

@article{arxiv.2404.17521,
  title  = {Ag2Manip: Learning Novel Manipulation Skills with Agent-Agnostic Visual and Action Representations},
  author = {Puhao Li and Tengyu Liu and Yuyang Li and Muzhi Han and Haoran Geng and Shu Wang and Yixin Zhu and Song-Chun Zhu and Siyuan Huang},
  journal= {arXiv preprint arXiv:2404.17521},
  year   = {2024}
}

备注

Project website and open-source code: https://xiaoyao-li.github.io/research/ag2manip