中文

逆向强化学习的快速收敛速率

机器学习 2026-05-15 v1 人工智能 机器学习

摘要

针对具有 Borel 状态和动作空间的有限时域 MDP 中具有线性奖励类的熵正则化极小极大逆向强化学习(Min-Max-IRL),我们建立了新的结构和统计结果。在结构方面,我们证明了极大似然估计(MLE)与 Min-Max-IRL 在总体水平上是等价的,并且在确定性动力学下在经验水平上也是等价的。在统计方面,利用 Min-Max-IRL 损失的伪自共轭性,我们证明了轨迹级 KL 散度和 Hessian 范数下的参数平方误差均以快速速率 O(n1)\mathcal{O}(n^{-1}) 衰减,其中 nn 为专家轨迹数。我们的保证在模型误设下同样适用,且不需要探索假设。我们进一步将奖励可辨识性结果推广至一般 Borel 空间,并推导了关于奖励参数的软最优值函数导数的新结果。

关键词

引用

@article{arxiv.2605.14599,
  title  = {Fast Rates for Inverse Reinforcement Learning},
  author = {Andreas Schlaginhaufen and Maryam Kamgarpour},
  journal= {arXiv preprint arXiv:2605.14599},
  year   = {2026}
}