用于分布强化学习的共轭离散分布
机器学习
2021-12-15 v1 人工智能
机器学习
摘要
在这项工作中,我们继续基于有限马尔可夫过程强化学习的近期进展展开研究。以往现有算法(无论是单智能体还是分布式)的一种常见做法是裁剪奖励或对 Q 函数施加变换方法,以处理真实折扣回报中幅度差异巨大的情况。我们从理论上证明,最成功的方法之一在非确定性过程中可能无法得到最优策略。作为解决方案,我们认为分布强化学习能够从根本上弥补这一缺陷。通过引入共轭分布算子,我们可以处理真实回报的一大类变换,并保证理论收敛性。我们提出了一种基于该算子的近似单智能体算法,利用由 Cramér 距离给出的恰当分布度量,直接在未修改的奖励上训练智能体。为评估其在随机环境中的性能,我们使用粘性动作(sticky-actions)在 55 款 Atari 2600 游戏上训练智能体,并与 Dopamine 框架中其他知名算法相比取得了最先进的性能。
引用
@article{arxiv.2112.07424,
title = {Conjugated Discrete Distributions for Distributional Reinforcement Learning},
author = {Björn Lindenberg and Jonas Nordqvist and Karl-Olof Lindahl},
journal= {arXiv preprint arXiv:2112.07424},
year = {2021}
}
备注
17 pages, 7 figures, conference