中文

具有通用函数逼近的对抗模仿学习的理论且实践高效方法

机器学习 2024-11-04 v1

摘要

作为模仿学习方法的一个突出类别,对抗模仿学习(AIL)凭借神经网络逼近已取得了显著的实践成功。然而,现有关于 AIL 的理论研究主要局限于表格和线性函数逼近等简化场景,且涉及复杂的算法设计,阻碍了实践实现,凸显了理论与实践之间的差距。本文探讨了具有通用函数逼近的在线 AIL 的理论基础。我们提出了一种新方法——基于优化的对抗模仿学习(OPT-AIL),其核心在于对奖励函数进行在线优化,以及对 Q 值函数进行乐观正则化的 Bellman 误差最小化。在理论上,我们证明 OPT-AIL 实现了学习接近专家策略的多项式专家样本复杂度和交互复杂度。据我们所知,OPT-AIL 是首个具有通用函数逼近且被证明高效的对抗模仿学习方法。在实践中,OPT-AIL 仅需对两个目标进行近似优化,从而便于实际实现。实证研究表明,OPT-AIL 在多个具有挑战性的任务中超越了先前最先进的深度 AIL 方法。

关键词

引用

@article{arxiv.2411.00610,
  title  = {Provably and Practically Efficient Adversarial Imitation Learning with General Function Approximation},
  author = {Tian Xu and Zhilong Zhang and Ruishuo Chen and Yihao Sun and Yang Yu},
  journal= {arXiv preprint arXiv:2411.00610},
  year   = {2024}
}

备注

Published in NeurIPS 2024: Tian Xu, Zhilong Zhang, Ruishuo Chen, Yihao Sun, Yang Yu. Provably and practically efficient adversarial imitation learning with general function approximation. In: Advances in Neural Information Processing Systems 38 (NeurIPS'24), Vancouver, Canada, 2024