AW-Opt:通过大规模模仿与强化学习机器人技能
机器人学
2021-11-12 v2
摘要
机器人技能可通过使用用户提供的演示进行模仿学习(IL)来习得,或通过利用大量自主收集经验的强化学习(RL)来习得。两种方法具有互补的优势与劣势:RL 可达到较高性能水平,但需要探索,这可能非常耗时且不安全;IL 不需要探索,但只能学习与所提供演示一样好的技能。单一方法能否结合两种途径的优势?许多先前方法致力于解决这一问题,提出了多种融合 IL 与 RL 要素的技术。然而,将此类方法扩展到整合多样离线数据并能有意义地泛化到真实场景的复杂机器人技能,仍是一项重大挑战。本文中,我们旨在测试先前 IL + RL 算法的可扩展性,并基于详实的实证实验设计出一个以最有效且可扩展方式组合现有组件的系统。为此,我们提出一系列旨在理解各设计决策影响的实验,从而开发出一种能够利用演示和异构先验数据在一系列真实世界与拟真模拟机器人问题上取得最佳性能的联合方法。我们称之为 AW-Opt 的完整方法,结合了优势加权回归 [1, 2] 与 QT-Opt [3] 的要素,为整合机器人操作中的演示与离线数据提供了统一途径。更多细节请见 https://awopt.github.io。
引用
@article{arxiv.2111.05424,
title = {AW-Opt: Learning Robotic Skills with Imitation and Reinforcement at Scale},
author = {Yao Lu and Karol Hausman and Yevgen Chebotar and Mengyuan Yan and Eric Jang and Alexander Herzog and Ted Xiao and Alex Irpan and Mohi Khansari and Dmitry Kalashnikov and Sergey Levine},
journal= {arXiv preprint arXiv:2111.05424},
year = {2021}
}