REBOOT:复用数据以引导高效真实世界灵巧操作
机器学习
2023-09-08 v1 人工智能
机器人学
摘要
涉及富含接触交互的灵巧操作任务对基于模型的控制系统与模仿学习算法均构成重大挑战。其复杂性源于多指机械手需要动态建立与断开接触、平衡非抓取力并控制大量自由度。强化学习(RL)因其普遍适用性与自主获取最优操作策略的能力而提供了一种有前景的途径。然而,其在真实世界中的应用常受限于需生成大量样本、重置环境及获取奖励信号。本工作中,我们引入一种利用 RL 学习灵巧操作技能的高效系统以缓解这些挑战。我们方法的核心思想在于结合近期样本高效 RL 与回放缓冲自举(replay buffer bootstrapping)的进展。该组合使我们能将来自不同任务或物体的数据作为训练新任务的起点,显著提升学习效率。此外,我们的系统通过基于模仿的拾取策略以及学习到的奖励函数来完成真实世界训练循环,消除了手动重置与奖励工程的需求。我们展示了复用过往数据作为新任务回放缓冲初始化的益处,例如在四指机械手上真实世界中快速习得复杂操作技能。(视频:https://sites.google.com/view/reboot-dexterous)
引用
@article{arxiv.2309.03322,
title = {REBOOT: Reuse Data for Bootstrapping Efficient Real-World Dexterous Manipulation},
author = {Zheyuan Hu and Aaron Rovinsky and Jianlan Luo and Vikash Kumar and Abhishek Gupta and Sergey Levine},
journal= {arXiv preprint arXiv:2309.03322},
year = {2023}
}
备注
Accepted at CORL 2023. The first two authors contributed equally