理解与缓解优先经验回放的局限性
人工智能
2022-06-14 v3 机器学习
摘要
优先经验回放(ER)已在经验上被证明可提升多领域的样本效率并引起广泛关注;然而,对于此类优先采样为何有效及其局限性,尚缺乏理论理解。本工作中,我们深入审视优先 ER。在监督学习设定下,我们展示了基于误差的优先采样方法(针对均方误差)与针对三次幂损失的一致采样之间的等价性。进而,我们从理论上阐释了其在学习初期相较一致采样提升收敛速率的原因。基于该见解,我们进一步指出优先 ER 方法的两个局限:1)过时的优先级与 2)样本空间覆盖不足。为缓解这些局限,我们提出了基于模型的随机梯度朗之万动力学采样方法。我们表明,该方法确实能提供接近于通过暴力法估计的理想优先采样分布的状态分布,而该理想分布不受上述两局限影响。我们在离散与连续控制问题上开展实验,以展示我们方法的有效性,并考察了该方法在自动驾驶应用中的实际意义。
引用
@article{arxiv.2007.09569,
title = {Understanding and Mitigating the Limitations of Prioritized Experience Replay},
author = {Yangchen Pan and Jincheng Mei and Amir-massoud Farahmand and Martha White and Hengshuai Yao and Mohsen Rohani and Jun Luo},
journal= {arXiv preprint arXiv:2007.09569},
year = {2022}
}
备注
Accepted to UAI2022