中文

无探索假设的折扣线性MDP中的模仿学习

机器学习 2024-08-26 v2

摘要

我们提出了一种用于无限时域线性MDP中模仿学习的新算法,名为ILARL,该算法极大地改进了学习者需要从环境中采样的轨迹数量界限。特别是,我们移除了先前工作中所需的探索假设,并将对期望精度ϵ\epsilon的依赖性从O(ϵ5)\mathcal{O}(\epsilon^{-5})改进到O(ϵ4)\mathcal{O}(\epsilon^{-4})。我们的结果依赖于模仿学习与具有对抗性损失的MDP中的在线学习之间的联系。对于后者,我们提出了无限时域线性MDP的首个结果,这可能具有独立的研究价值。此外,我们能够为有限时域情况提供一个更强的结果,达到了O(ϵ2)\mathcal{O}(\epsilon^{-2})。使用线性函数逼近的数值实验表明,ILARL优于其他常用算法。

关键词

引用

@article{arxiv.2405.02181,
  title  = {Imitation Learning in Discounted Linear MDPs without exploration assumptions},
  author = {Luca Viano and Stratis Skoulakis and Volkan Cevher},
  journal= {arXiv preprint arXiv:2405.02181},
  year   = {2024}
}

备注

Accepted at ICML 2024