模仿策略与环境误差界
机器学习
2020-10-23 v1
摘要
模仿学习通过模仿专家演示来训练策略。各类模仿方法已被提出并经过实证评估,同时其理论理解尚需进一步研究。本文中,我们首先通过行为克隆和生成对抗模仿两种模仿方法分析专家策略与模仿策略之间的价值差距。结果支持生成对抗模仿相比行为克隆能减少复合误差,从而具有更好的样本复杂度。注意到将环境转移模型视为对偶智能体,模仿学习也可用于学习环境模型。因此,基于模仿策略的误差界,我们进一步分析模仿环境的性能。结果表明,环境模型可通过生成对抗模仿比行为克隆更有效地被模仿,这为基于模型的强化学习中的对抗模仿提出了一个新颖应用。我们希望这些结果能启发模仿学习与基于模型的强化学习的未来进展。
引用
@article{arxiv.2010.11876,
title = {Error Bounds of Imitating Policies and Environments},
author = {Tian Xu and Ziniu Li and Yang Yu},
journal= {arXiv preprint arXiv:2010.11876},
year = {2020}
}
备注
Appears in NeurIPS 2020