中文

具收敛保证的高效离策略对抗性模仿学习

机器学习 2024-05-28 v1

摘要

对抗性模仿学习(AIL)因依赖足够的 on-policy 数据来评估当前策略的性能而面临样本效率问题。在本工作中,我们研究了离策略 AIL 算法的收敛性质和样本复杂度。我们表明,即使在缺乏重要性抽样校正的情况下,使用由 o(K)o(\sqrt{K}) 最近的策略(其中 KK 为策略更新和奖励更新的迭代次数)生成的样本,不会损害该类算法的收敛保证。进一步地,我们的结果表明,离策略更新导致的分布迁移误差被更大数据可得性的收益所主导。这一结果为 AIL 算法的样本效率提供了理论支持。据我们所知,这是首个为离策略 AIL 算法提供理论保证的工作。

关键词

引用

@article{arxiv.2405.16668,
  title  = {Provably Efficient Off-Policy Adversarial Imitation Learning with Convergence Guarantees},
  author = {Yilei Chen and Vittorio Giammarino and James Queeney and Ioannis Ch. Paschalidis},
  journal= {arXiv preprint arXiv:2405.16668},
  year   = {2024}
}