中文

基于散度最小化的模仿学习方法视角

机器学习 2019-11-07 v1 机器学习

摘要

在许多场景中,希望通过从专家示范中学习或引导来学习决策与控制策略。该模仿学习(IL)框架下最常见的方法是行为克隆(BC)和逆强化学习(IRL)。近期的 IRL 方法已展示出在仅能访问极有限示范集的情况下学习有效策略的能力,而 BC 方法在此场景中常失败。不幸的是,由于多种变化因素,直接比较这些方法无法为理解此性能差异提供充分直觉。本工作中,我们基于散度最小化提出 IL 算法的统一概率视角。我们提出 ff-MAX,即最先进 IRL 方法 AIRL [Fu et al., 2018] 的 ff-散度推广。ff-MAX 使我们能关联先前的 IRL 方法如 GAIL [Ho & Ermon, 2016] 和 AIRL [Fu et al., 2018],并理解其算法性质。通过散度最小化视角,我们梳理了 BC 与成功 IRL 方法之间的差异,并在模拟高维连续控制域上对这些细微差别进行经验评估。我们的发现明确识别出 IRL 的状态边际匹配目标对其优越性能贡献最大。最后,我们将对 IL 方法的新理解应用于状态边际匹配问题,证明在模拟机械臂推动环境中,仅使用手工指定的状态分布而无奖励函数或专家示范,即可教会智能体多种多样的行为。数据集与结果复现请参考 https://github.com/KamyarGh/rl_swiss/blob/master/reproducing/fmax_paper.md 。

关键词

引用

@article{arxiv.1911.02256,
  title  = {A Divergence Minimization Perspective on Imitation Learning Methods},
  author = {Seyed Kamyar Seyed Ghasemipour and Richard Zemel and Shixiang Gu},
  journal= {arXiv preprint arXiv:1911.02256},
  year   = {2019}
}

备注

Published at Conference on Robot Learning (CoRL) 2019. For datasets and reproducing results please refer to https://github.com/KamyarGh/rl_swiss/blob/master/reproducing/fmax_paper.md