面向深度Q学习的状态分布感知采样
机器学习
2018-04-25 v1 人工智能
机器学习
摘要
强化学习中一个关键且具挑战性的问题是如何从经验回放缓冲中学习状态-动作值函数,同时保持样本效率并更快收敛至高质量解。在先前工作中,转移样本从回放缓冲中随机均匀采样,或依据由时序差分(TD)误差度量的优先级采样。然而,这些方法未充分考量状态空间中转移分布的内在特性,可能导致冗余且不必要的 TD 更新,拖慢学习过程收敛。为克服该问题,我们提出一种新颖的状态分布感知采样方法,以平衡偏斜分布转移的回放次数,其同时考虑转移出现频率与状态-动作值的不确定性。因而,我们的方法可减少不必要的 TD 更新,并增加对不确定性较大状态-动作值的 TD 更新,使经验回放更为有效高效。基于 OpenAI gym 平台,我们在经典控制任务与 Atari 2600 游戏上开展了广泛实验,结果相较标准 DQN 方法证明了本方法的有效性。
引用
@article{arxiv.1804.08619,
title = {State Distribution-aware Sampling for Deep Q-learning},
author = {Weichao Li and Fuxian Huang and Xi Li and Gang Pan and Fei Wu},
journal= {arXiv preprint arXiv:1804.08619},
year = {2018}
}
备注
this paper has been submitted to neural processing letters