中文

基于显露偏好与被动随机优化的逆强化学习

机器学习 2025-07-08 v1 信号处理

摘要

本专著分为三章,探讨了逆强化学习(IRL)。前两章通过微观经济学中的显露偏好理论视角来理解逆强化学习,第三章则研究基于Langevin动力学的自适应IRL方法。章节运用经典的显露偏好理论(阿弗里特定理及其推广),识别基于观察行为的受限效用最大化者,从而重构代理人效用的集合估计。我们通过识别认知雷达的存在并重构其效用函数来说明此程序。该章节还讨论了当代理人行为受噪声污染时,构建效用最大化行为统计检测器的方法。第二章研究贝叶斯逆强化学习,探讨分析师如何判断观察到的代理人是否为理性注意贝叶斯效用最大化者(即同时优化其效用和观察似然性)。该章节关注逆停止时间问题,聚焦于重构在随机时限下运行的贝叶斯代理人的继续成本和停止成本。随后我们将此IRL方法论用于识别贝叶斯最优顺序检测器的存在。此外,第二章提供了离散选择模型、逆贝叶斯滤波以及自适应IRL的逆随机梯度算法的简要概述。第三章引入一种基于被动Langevin动力学的自适应IRL方法。该方法旨在跟踪给定噪声和误指定梯度的时变效用函数。本质上,第三章中呈现的自适应IRL算法可被视为逆随机梯度算法,因为它们在随机梯度算法运行期间实时学习效用函数。

关键词

引用

@article{arxiv.2507.04396,
  title  = {Inverse Reinforcement Learning using Revealed Preferences and Passive Stochastic Optimization},
  author = {Vikram Krishnamurthy},
  journal= {arXiv preprint arXiv:2507.04396},
  year   = {2025}
}

备注

arXiv admin note: text overlap with arXiv:2006.11674