中文

逆强化学习与动态离散选择模型的高效推断

机器学习 2026-01-01 v1 统计理论 统计理论

摘要

逆强化学习 (IRL) 和动态离散选择 (DDC) 模型通过恢复使观察到的行为合理化的奖励函数来解释序贯决策。灵活的 IRL 方法通常依赖机器学习,但无法保证有效推断,而经典的 DDC 方法则施加限制性的参数设定,且常需重复动态规划。我们为去偏逆强化学习开发了一个半参数框架,该框架为最大熵 IRL 和 Gumbel 冲击 DDC 模型中一大类依赖奖励的泛函提供了统计上高效的推断。我们证明,对数行为策略充当伪奖励,可点识别策略价值差异,并在简单归一化下识别奖励本身。然后,我们将这些目标——包括已知和反事实 softmax 策略下的策略价值以及归一化奖励的泛函——形式化为行为策略和转移核的光滑泛函,建立路径可微性,并推导其高效影响函数。基于此特征,我们构建了自动去偏机器学习估计量,允许对冗余成分进行灵活的非参数估计,同时实现 n\sqrt{n} 一致性、渐近正态性和半参数效率。我们的框架将 DDC 模型的经典推断扩展到非参数奖励和现代机器学习工具,为 IRL 中的统计推断提供了一种统一且计算上易于处理的方法。

关键词

引用

@article{arxiv.2512.24407,
  title  = {Efficient Inference for Inverse Reinforcement Learning and Dynamic Discrete Choice Models},
  author = {Lars van der Laan and Aurelien Bibaut and Nathan Kallus},
  journal= {arXiv preprint arXiv:2512.24407},
  year   = {2026}
}