基于经验风险最小化的离线逆强化学习与动态离散选择模型方法
机器学习
2026-05-06 v7 人工智能
计量经济学
摘要
我们研究了动态离散选择(DDC)模型估计的问题,亦即离线最大熵正则化逆强化学习(offline MaxEnt-IRL)中的问题。该方法旨在从离线行为数据中恢复控制行为的奖励函数或 Q* 函数。本文提出了一种无需对线性参数化奖励函数施加限制即可求解此类问题的全局收敛梯度方法。我们方法的创新之处在于引入基于经验风险最小化(ERM)的 IRL/DDC 框架,无需在 Bellman 方程中显式估计状态转移概率。此外,我们的方法与非参数估计技术(如神经网络)兼容。因此,所提出的方法有望扩展到高维、无限状态空间。我们方法背后的关键理论洞见是,Bellman 残差满足波基亚-洛亚斯维茨(Polyak-Lojasiewicz, PL)条件——这一属性虽然比强凸性弱,但足以保证快速的全局收敛保证。通过一系列合成实验,我们展示了该方法在基准方法和最新方法中始终表现优异。
引用
@article{arxiv.2502.14131,
title = {An Empirical Risk Minimization Approach for Offline Inverse RL and Dynamic Discrete Choice Model},
author = {Enoch H. Kang and Hema Yoganarasimhan and Lalit Jain},
journal= {arXiv preprint arXiv:2502.14131},
year = {2026}
}