中文

基于核的极大熵逆向强化学习用于均场游戏

机器学习 2026-03-06 v2 最优化与控制

摘要

我们考虑面向无限时程stationary均场游戏(MFG)的极大因果熵逆向强化学习(IRL)问题,其中我们将未知奖励函数建模于再生产核希尔空间(RKHS)中。这使得我们能够直接从专家演示中推断出丰富且可能非线性的奖励结构,与大多数现有MFG方法通常将奖励限制为固定有限基函数集合的线性组合且依赖有限时程 formulation 形成鲜明对比。我们引入拉格朗日松弛,使问题可转化为无约束对数似然最大化,并通过梯度上升算法求解。为建立算法的理论一致性,我们通过证明相关软Bellman算子关于RKHS中参数的Fréchet可微性,从而证明对数似然目标函数的光滑性。为说明RKHS形式的实际优势,我们在一个 exhibiting state-dependent preference reversal 的均场交通路由游戏中进行验证,其中基于核的方法相较于具有相当参数数量的线性奖励基准可将策略恢复误差降低一个数量级以上。此外,我们将该框架扩展至有限时程non-stationary情境。我们表明,在该情境下,对数似然重构在结构上不可用,因而我们通过Danskin定理开发了在凸对偶上的梯度下降算法,建立了光滑性和收敛性保证。

关键词

引用

@article{arxiv.2507.14529,
  title  = {Kernel Based Maximum Entropy Inverse Reinforcement Learning for Mean-Field Games},
  author = {Berkay Anahtarci and Can Deha Kariksiz and Naci Saldi},
  journal= {arXiv preprint arXiv:2507.14529},
  year   = {2026}
}