面向随机梯度算法自适应逆强化学习的朗之万动力学方法
机器学习
2021-01-19 v2 系统与控制
系统与控制
机器学习
摘要
逆强化学习(IRL)旨在通过观测优化智能体的响应(估计值或动作)来估计其奖励函数。本文考虑在观测到多个随机梯度智能体生成的奖励函数梯度的含噪估计时进行的 IRL。我们提出一种广义朗之万动力学算法来估计奖励函数 ;具体而言,所得朗之万算法渐近地从正比于 的分布中生成样本。所提出的 IRL 算法采用基于核的被动学习方案。我们还构建了适用于高维数据的多核被动朗之万 IRL 算法。所提 IRL 算法的性能在自适应贝叶斯学习、逻辑回归(高维问题)和约束马尔可夫决策过程的实例中得到展示。我们利用鞅平均方法证明了所提 IRL 算法的弱收敛性。我们还分析了在效用函数 随时间作为慢速马尔可夫链发生跳变的平稳环境中的 IRL 算法跟踪性能。
引用
@article{arxiv.2006.11674,
title = {Langevin Dynamics for Adaptive Inverse Reinforcement Learning of Stochastic Gradient Algorithms},
author = {Vikram Krishnamurthy and George Yin},
journal= {arXiv preprint arXiv:2006.11674},
year = {2021}
}