中文

基于 GAN 的融合示范与人类评价反馈的交互式强化学习

机器学习 2021-04-15 v1 人工智能 机器人学

摘要

深度强化学习(DRL)已在许多模拟任务中取得巨大成功。样本低效问题使得将传统 DRL 方法应用于真实机器人成为巨大挑战。生成对抗模仿学习(GAIL)——一种通用的无模型模仿学习方法,允许机器人在大型环境中直接从专家轨迹学习策略。然而,GAIL 与其他模仿学习方法一样存在局限:它们很少能超越示范的性能。本文为克服 GAIL 的局限,结合 GAIL 与交互式强化学习的优势,提出了基于 GAN 的融合示范与人类评价反馈的交互式强化学习(GAIRL)。我们在六项基于物理的控制任务中测试了所提方法,从简单的低维控制任务——Cart Pole 和 Mountain Car,到困难的高维任务——Inverted Double Pendulum、Lunar Lander、Hopper 和 HalfCheetah。我们的结果表明,无论使用最优还是次优示范,GAIRL 智能体总能学习到具有最优或接近最优性能的更稳定策略,而 GAIL 智能体的性能上限受限于示范性能甚至更差。此外,我们的结果表明 GAIRL 优于 GAIL 的原因在于示范与人类评价反馈的互补效应。

关键词

引用

@article{arxiv.2104.06600,
  title  = {GAN-Based Interactive Reinforcement Learning from Demonstration and Human Evaluative Feedback},
  author = {Jie Huang and Rongshun Juan and Randy Gomez and Keisuke Nakamura and Qixin Sha and Bo He and Guangliang Li},
  journal= {arXiv preprint arXiv:2104.06600},
  year   = {2021}
}