中文

对抗模仿学习的泛化性及其超越

机器学习 2022-02-14 v3 人工智能

摘要

尽管已有大量实证评估,模仿学习中的一个基本问题仍未被完全解决:AIL(对抗模仿学习)是否在理论上比 BC(行为克隆)泛化得更好?我们在表格型与回合制 MDP 下研究这一开放问题。对于使用直接最大似然估计的朴素 AIL,我们在已知转移设定下给出了否定与肯定的双重答案。对于某些 MDP,我们表明朴素 AIL 的样本复杂度比 BC 更差。关键洞见在于状态-动作分布匹配原则较弱,使得 AIL 即便在专家演示所访问过的状态上也可能泛化很差。对于另一类 MDP,朴素 AIL 被证明即便在未访问状态上也能良好泛化。有趣的是,其样本复杂度是无 horizon 的,这在理论上以显著优势击败 BC。最后,我们在未知转移场景下建立了一个框架,使 AIL 能够通过无奖励探索策略进行探索。与已知最优的在线学徒学习算法相比,所得算法改进了样本复杂度与交互复杂度。

关键词

引用

@article{arxiv.2106.10424,
  title  = {On Generalization of Adversarial Imitation Learning and Beyond},
  author = {Tian Xu and Ziniu Li and Yang Yu and Zhi-Quan Luo},
  journal= {arXiv preprint arXiv:2106.10424},
  year   = {2022}
}