面向实用的深度强化学习信用分配
机器学习
2022-02-15 v2 人工智能
摘要
信用分配是强化学习中的一个基本问题,即衡量一个动作对未来奖励影响的问题。显式信用分配方法有可能提升 RL 算法在许多任务上的表现,但迄今为止仍不实用,难以通用。近来,提出了一类称为后见之明信用分配(HCA)的方法,其基于动作导致所观测结果的概率,在事后显式地将信用分配给动作。该方法具有吸引人的性质,但基本上仍是一个理论构想,仅适用于有限的表格型 RL 任务。此外,如何将 HCA 扩展到深度 RL 环境尚不清楚。在本工作中,我们探索了在深度 RL 语境下使用 HCA 风格的信用。我们首先描述了现有 HCA 算法在深度 RL 中导致其表现不佳或完全无法训练的局限性,随后提出了若干有理论依据的修改以克服它们。我们探究了所得算法在 Arcade Learning Environment(ALE)基准上的定量与定性效应,并观察到它在许多需要非平凡信用分配以取得高分且后见概率可被准确估计的游戏中,表现优于 Advantage Actor-Critic(A2C)。
引用
@article{arxiv.2106.04499,
title = {Towards Practical Credit Assignment for Deep Reinforcement Learning},
author = {Vyacheslav Alipov and Riley Simmons-Edler and Nikita Putintsev and Pavel Kalinin and Dmitry Vetrov},
journal= {arXiv preprint arXiv:2106.04499},
year = {2022}
}
备注
8 pages plus 8 page appendix