无探索假设的折扣线性MDP中的模仿学习
机器学习
2024-08-26 v2
摘要
我们提出了一种用于无限时域线性MDP中模仿学习的新算法,名为ILARL,该算法极大地改进了学习者需要从环境中采样的轨迹数量界限。特别是,我们移除了先前工作中所需的探索假设,并将对期望精度的依赖性从改进到。我们的结果依赖于模仿学习与具有对抗性损失的MDP中的在线学习之间的联系。对于后者,我们提出了无限时域线性MDP的首个结果,这可能具有独立的研究价值。此外,我们能够为有限时域情况提供一个更强的结果,达到了。使用线性函数逼近的数值实验表明,ILARL优于其他常用算法。
引用
@article{arxiv.2405.02181,
title = {Imitation Learning in Discounted Linear MDPs without exploration assumptions},
author = {Luca Viano and Stratis Skoulakis and Volkan Cevher},
journal= {arXiv preprint arXiv:2405.02181},
year = {2024}
}
备注
Accepted at ICML 2024