用于强化学习的对抗式内在动机
机器学习
2021-10-29 v3
摘要
以最小化与参考分布的不匹配为目标的学习已被证明对生成建模和模仿学习有用。在本文中,我们研究这样一个目标——即策略的状态访问分布与目标分布之间的 Wasserstein-1 距离——是否能有效用于强化学习(RL)任务。具体而言,本文关注目标条件强化学习,其中理想化(不可达)的目标分布在目标处具有全测度。本文引入一个特定于马尔可夫决策过程(MDP)的拟度量,并使用该拟度量来估计上述 Wasserstein-1 距离。它进一步表明,最小化该 Wasserstein-1 距离的策略正是以尽可能少的步数到达目标的策略。我们的方法称为对抗式内在动机(AIM),通过其对偶目标估计该 Wasserstein-1 距离,并用它计算补充奖励函数。我们的实验表明,该奖励函数相对于 MDP 中的转移平滑变化,并引导智能体的探索以高效找到目标。此外,我们将 AIM 与 Hindsight Experience Replay (HER) 结合,并表明所得算法在若干模拟机器人任务上与其他鼓励探索或加速学习的奖励相比显著加速了学习。
引用
@article{arxiv.2105.13345,
title = {Adversarial Intrinsic Motivation for Reinforcement Learning},
author = {Ishan Durugkar and Mauricio Tec and Scott Niekum and Peter Stone},
journal= {arXiv preprint arXiv:2105.13345},
year = {2021}
}