逆向强化学习中悲观主义的优点
机器学习
2024-02-09 v2
摘要
逆向强化学习(Inverse Reinforcement Learning, IRL)是一个从专家演示中学习复杂行为的强大框架。然而,传统上它需要在其内循环中反复解决计算昂贵的强化学习(Reinforcement Learning, RL)问题。利用内循环 RL 中的专家演示来减少探索负担是可取的。例如,最近的工作将学习者重置为专家状态,以告知学习者高奖励的专家状态。然而,这种方法在现实世界中是不可行的。在这项工作中,我们考虑了一种加速 IRL 中 RL 子程序的替代方法:悲观主义(pessimism),即靠近专家的数据分布,通过离线 RL 算法实例化。我们形式化了离线 RL 与 IRL 之间的联系,使我们能够使用任意离线 RL 算法来提高 IRL 的样本效率。我们通过实验验证了我们的理论,展示了离线 RL 算法的有效性与它作为 IRL 过程一部分的表现之间存在强相关性。通过在 IRL 过程中使用强大的离线 RL 算法,我们能够比现有技术更高效地找到与专家性能相匹配的策略。
引用
@article{arxiv.2402.02616,
title = {The Virtues of Pessimism in Inverse Reinforcement Learning},
author = {David Wu and Gokul Swamy and J. Andrew Bagnell and Zhiwei Steven Wu and Sanjiban Choudhury},
journal= {arXiv preprint arXiv:2402.02616},
year = {2024}
}
备注
This paper has been withdrawn by the authors pending edits from other authors