通过谱强化学习适应奖励渐进性
机器学习
2021-04-30 v1
摘要
本文考虑具有渐进性奖励的强化学习任务;即奖励幅度随时间推移而增大的任务。我们假设这一性质可能对基于价值的深度强化学习智能体造成问题,特别是当智能体必须首先在任务中相对无奖励的区域取得成功才能到达更有奖励的区域时。为解决此问题,我们提出 Spectral DQN,它将奖励分解为频率,使得高频仅在发现大奖励时被激活。这使得训练损失得以平衡,从而在小奖励区域和大奖励区域间给出更均匀的权重。在两个具有极端奖励渐进性、标准基于价值的方法表现严重不佳的领域,Spectral DQN 能够取得更远的进展。此外,在一组六个不明显偏向该方法的标准 Atari 游戏上评估时,Spectral DQN 仍具竞争力:尽管在单个游戏中其表现不及某一基准,但在三个游戏中轻松超越基准。这些结果表明该方法并未过拟合于其目标问题,并暗示 Spectral DQN 可能具有超越解决奖励渐进性的优势。
引用
@article{arxiv.2104.14138,
title = {Adapting to Reward Progressivity via Spectral Reinforcement Learning},
author = {Michael Dann and John Thangarajah},
journal= {arXiv preprint arXiv:2104.14138},
year = {2021}
}
备注
16 pages, 8 figures, 3 tables, accepted as a conference paper at ICLR 2021