逆向强化学习的快速收敛速率
机器学习
2026-05-15 v1 人工智能
机器学习
摘要
针对具有 Borel 状态和动作空间的有限时域 MDP 中具有线性奖励类的熵正则化极小极大逆向强化学习(Min-Max-IRL),我们建立了新的结构和统计结果。在结构方面,我们证明了极大似然估计(MLE)与 Min-Max-IRL 在总体水平上是等价的,并且在确定性动力学下在经验水平上也是等价的。在统计方面,利用 Min-Max-IRL 损失的伪自共轭性,我们证明了轨迹级 KL 散度和 Hessian 范数下的参数平方误差均以快速速率 衰减,其中 为专家轨迹数。我们的保证在模型误设下同样适用,且不需要探索假设。我们进一步将奖励可辨识性结果推广至一般 Borel 空间,并推导了关于奖励参数的软最优值函数导数的新结果。
引用
@article{arxiv.2605.14599,
title = {Fast Rates for Inverse Reinforcement Learning},
author = {Andreas Schlaginhaufen and Maryam Kamgarpour},
journal= {arXiv preprint arXiv:2605.14599},
year = {2026}
}