多目标强化学习的无偏方法
机器学习
2021-06-17 v1
摘要
在多目标强化学习(RL)设定中,每个目标的奖励是稀疏的,且位于该目标的一个小邻域内。在高维情况下,获得奖励的概率趋于零,智能体接收到的学习信号很少。诸如 Hindsight Experience Replay (HER) 等方法通过从已实现但非计划内的目标中学习来解决此问题。但已知 HER 会引入偏差,并可能因高估偶然结果而收敛到低回报策略。首先,我们为 HER 正名,证明在确定性环境(如许多最优控制设定)中它实际上是无偏的。接下来,对于连续空间中的随机环境,我们通过直接取无限稀疏奖励极限来解决稀疏奖励问题。我们完整形式化了在每个目标处具有无限稀疏 Dirac 奖励的多目标 RL 问题。我们引入了能够处理此类无限稀疏奖励的无偏深度 Q-learning 和 actor-critic 算法,并在玩具环境中进行了测试。
引用
@article{arxiv.2106.08863,
title = {Unbiased Methods for Multi-Goal Reinforcement Learning},
author = {Léonard Blier and Yann Ollivier},
journal= {arXiv preprint arXiv:2106.08863},
year = {2021}
}
备注
9 pages