中文

仅用分类和少量回归进行逆强化学习

机器学习 2026-05-11 v2 计量经济学 最优化与控制 机器学习

摘要

逆强化学习(IRL)旨在从观察到的行为中推断奖励函数, 但奖励函数无法仅凭策略唯一确定: 许多奖励-值对都能合理地解释相同的动作。因此, 有意义的奖励恢复需要归一化, 但现有的归一化 IRL 方法常依赖锚定动作限制或专用神经网络结构。我们在广泛的状态相关仿射归一化下研究奖励恢复, 将锚定动作约束作为特殊情况。由此得到广义策略-到-Q-到-奖励(GenPQR)方法, 其模块化地估计行为策略, 通过 Bellman 方程评估其软 Q 函数, 并恢复归一化奖励。两个阶段都可使用标准的分类和回归方法实现。我们在一般函数逼近下证明了模块化的有限样本保证, 分别处理策略估计和 Q 估计误差。作为具体实例, 我们研究使用拟合 Q 评估实现 GenPQR, 将 IRL 简化为策略估计后跟回归。实验表明, GenPQR 在奖励恢复方面与 DeepPQR 相当或更好, 同时更简单更模块化。与 DeepPQR 相比, 本文的理论不局限于锚定动作, 可容纳大规模连续动作空间, 明确了覆盖要求, 且不绑定于特定的神经网络结构或训练程序。

关键词

引用

@article{arxiv.2509.21172,
  title  = {Inverse Reinforcement Learning with Just Classification and a Few Regressions},
  author = {Lars van der Laan and Nathan Kallus and Aurelien Bibaut},
  journal= {arXiv preprint arXiv:2509.21172},
  year   = {2026}
}