Deep PQR:利用锚动作求解逆强化学习
机器学习
2021-04-12 v2 最优化与控制
机器学习
摘要
我们提出了一种用于深度基于能量的策略下逆强化学习的奖励函数估计框架。我们将该方法命名为 PQR,因为它通过深度学习依次估计策略(Policy)、 函数和奖励(Reward)函数。PQR 不假设奖励仅依赖于状态,而是允许其依赖于动作的选择。此外,PQR 允许随机状态转移。为此,我们假设存在一个奖励已知的锚动作,通常是“什么都不做”的动作,其不产生奖励。我们给出了 PQR 方法的估计量和算法。当环境转移已知时,我们证明 PQR 奖励估计量能唯一恢复真实奖励。在转移未知时,我们给出了 PQR 的估计误差界。最后,通过合成和真实世界数据集展示了 PQR 的性能。
引用
@article{arxiv.2007.07443,
title = {Deep PQR: Solving Inverse Reinforcement Learning using Anchor Actions},
author = {Sinong Geng and Houssam Nassif and Carlos A. Manzanares and A. Max Reppen and Ronnie Sircar},
journal= {arXiv preprint arXiv:2007.07443},
year = {2021}
}