通过面向对象的奖励弥合人类与机器人灵巧性差距
机器人学
2024-10-31 v1 机器学习
摘要
从人类视频中直接训练机器人是机器人学和计算机视觉中的一个新兴领域。虽然在两指夹爪方面取得了显著进展,但以这种方式学习多指机器人手的自主任务仍然具有挑战性。造成这一困难的关键原因是,在人类手上训练的策略可能由于形态差异而无法直接迁移到机器人手上。在本工作中,我们提出了 HuDOR,一种通过直接从人类视频中计算奖励来实现策略在线微调的技术。重要的是,该奖励函数利用来自现成点追踪器的面向对象轨迹构建,尽管存在形态差距和人类手与机器人手之间的视觉差异,仍能提供有意义的学习信号。给定一段人类解决任务的视频,例如轻轻打开音乐盒,HuDOR 使我们的四指 Allegro 手仅需一小时的在线交互即可学会该任务。我们在四项任务上的实验表明,HuDOR 相比基线方法实现了 4 倍的性能提升。代码和视频可在我们的网站 https://object-rewards.github.io 上获取。
引用
@article{arxiv.2410.23289,
title = {Bridging the Human to Robot Dexterity Gap through Object-Oriented Rewards},
author = {Irmak Guzey and Yinlong Dai and Georgy Savva and Raunaq Bhirangi and Lerrel Pinto},
journal= {arXiv preprint arXiv:2410.23289},
year = {2024}
}