中文

正确实现逆Q学习:$Q^\pi$可实现MDP中的离线模仿学习

机器学习 2026-01-09 v4

摘要

我们研究马尔可夫决策过程(MDP)中的离线模仿学习问题,其目标是在由专家策略生成的状态-动作对数据集下学习一个性能良好的策略。补充近期假设专家属于已知且可处理策略类的研究路线,我们从一个新角度切入该问题,并利用关于环境的另一类结构假设。具体而言,针对线性QπQ^\pi可实现MDP类,我们提出了一种名为鞍点离线模仿学习(\SPOIL)的新算法,该算法保证在获取O(ε2)\mathcal{O}(\varepsilon^{-2})样本的情况下,匹配任何专家的性能且误差不超过ε\varepsilon。此外,我们将该结果推广至可能非线性的QπQ^\pi可实现MDP,代价是样本复杂度变差至O(ε4)\mathcal{O}(\varepsilon^{-4})阶。最后,我们的分析为深度模仿学习中从专家数据训练评论网络提出了一种新的损失函数。在标准基准上的实证评估表明,\SPOIL的神经网络实现优于行为克隆,并与SOTA算法具有竞争力。

关键词

引用

@article{arxiv.2505.19946,
  title  = {Inverse Q-Learning Done Right: Offline Imitation Learning in $Q^\pi$-Realizable MDPs},
  author = {Antoine Moulin and Gergely Neu and Luca Viano},
  journal= {arXiv preprint arXiv:2505.19946},
  year   = {2026}
}