中文

视觉回溯遥操作:一种面向离线基于图像的强化学习的数据收集协议

机器人学 2022-10-06 v1 机器学习

摘要

我们考虑如何最高效地利用遥操作员时间,为稀疏奖励机器人任务收集数据以学习鲁棒的基于图像的价值函数与策略。为实现此目标,我们修改了数据收集过程,使其不仅包含所需任务的成功演示。相反,我们开发了一种称为视觉回溯遥操作(VBT)的新协议,其有意收集包含视觉相似失败、恢复与成功的数据集。VBT数据收集对于从小规模基于图像的观测数据集中高效学习准确价值函数尤为有用。我们在真实机器人上演示了VBT,以从图像观测中对T恤抓取这一可变形操纵任务执行连续控制。我们发现,通过调整数据收集过程,相较于多种数据收集基线方法,我们提升了所学价值函数与策略的质量。具体而言,我们发现当两种方法均给定来自真实机器人的60分钟等量数据集时,在VBT数据上的离线强化学习比在成功演示数据上的标准行为克隆性能高出13%。

关键词

引用

@article{arxiv.2210.02343,
  title  = {Visual Backtracking Teleoperation: A Data Collection Protocol for Offline Image-Based Reinforcement Learning},
  author = {David Brandfonbrener and Stephen Tu and Avi Singh and Stefan Welker and Chad Boodoo and Nikolai Matni and Jake Varley},
  journal= {arXiv preprint arXiv:2210.02343},
  year   = {2022}
}