单次模仿:执行不匹配下的机器人仿真
机器人学
2025-04-01 v6 人工智能
机器学习
摘要
人类演示作为提示词是编程机器人执行长时段操作任务的强大方法。然而,将这些演示转化为机器人可执行的动作由于运动风格和物理能力的执行不匹配,面临着显著的挑战。现有的人机翻译方法要么依赖配对数据,这种数据难以大规模扩展,要么高度依赖帧级视觉相似性,而这在实际中常常失效。为解决这些挑战,我们提出了 RHyME 框架,该框架使用序列级最优传输成本函数自动配对人类和机器人轨迹。给定长时段机器人演示数据,RHyME 通过检索和组合短时段人类视频片段来合成语义等价的人类视频。这一方法无需配对数据即可进行有效的策略训练。RHyME 成功地仿真了各种跨体现形式的演示者,在仿真环境中以及使用真实人类手部时,均实现了比以前方法超过 50% 的任务成功率提升。我们将在 https://portal-cornell.github.io/rhyme/ 上发布代码和数据集。
引用
@article{arxiv.2409.06615,
title = {One-Shot Imitation under Mismatched Execution},
author = {Kushal Kedia and Prithwish Dan and Angela Chao and Maximus Adrian Pace and Sanjiban Choudhury},
journal= {arXiv preprint arXiv:2409.06615},
year = {2025}
}