关于模仿学习的值差异
机器学习
2019-11-19 v1 人工智能
机器学习
摘要
模仿学习从专家示范中训练策略。模仿学习方法已基于多种原理设计,例如通过监督学习的行为克隆、通过逆强化学习的学徒学习,以及通过生成对抗学习的 GAIL。在本文中,我们提出一个基于差异传播分析来分析模仿学习方法理论性质的框架。在无限 horizon 设定下,该框架得出行为克隆的值差异为 O((1-\gamma)^{-2}) 阶。我们还表明该框架得出 GAIL 的值差异为 O((1-\gamma)^{-1}) 阶。这意味着 GAIL 比行为克隆具有更少的复合误差,本文中也通过实验验证了这一点。据我们所知,我们是首个从理论上传析 GAIL 性能的工作。上述结果表明所提框架是分析模仿学习方法的通用工具。我们希望我们的理论结果能为模仿学习算法的未来改进提供见解。
引用
@article{arxiv.1911.07027,
title = {On Value Discrepancy of Imitation Learning},
author = {Tian Xu and Ziniu Li and Yang Yu},
journal= {arXiv preprint arXiv:1911.07027},
year = {2019}
}