中文

矩与匹配:缩小模仿差距的博弈论框架

机器学习 2021-06-14 v2 机器人学 机器学习

摘要

我们通过矩匹配(moment matching)的视角,为以往一大类模仿学习算法提供了统一的认识。该分类框架的核心在于:学习者试图匹配专家行为的(1)奖励矩还是(2)动作价值矩,每种选择对应不同的算法路径。通过考虑学习者与专家行为之间对抗性选择的散度,我们得以推导出适用于这两类中所有算法的策略性能界,据我们所知尚属首次。我们还引入了矩可恢复性(moment recoverability)这一概念——其隐含于许多既往模仿学习分析中——使我们能清晰界定各算法族缓解复合误差的能力。我们推导了三种具有强保证、实现简单且经验表现具竞争力的新颖算法模板(AdVIL、AdRIL 与 DAeQuIL)。

关键词

引用

@article{arxiv.2103.03236,
  title  = {Of Moments and Matching: A Game-Theoretic Framework for Closing the Imitation Gap},
  author = {Gokul Swamy and Sanjiban Choudhury and J. Andrew Bagnell and Zhiwei Steven Wu},
  journal= {arXiv preprint arXiv:2103.03236},
  year   = {2021}
}