深度强化学习中可复现性的确定性实现
人工智能
2019-06-11 v5
摘要
尽管深度强化学习(DRL)近年来取得了众多成功,但复现这些成功可能极具挑战性。与DRL特别相关的一个可复现性挑战是训练过程中的非确定性,其会显著影响结果。受此挑战启发,我们研究了确定性实现在消除训练中非确定性方面的积极作用。为此,我们考虑深度Q学习算法的具体案例,通过识别并控制训练过程中所有非确定性来源,构建其确定性实现。随后,我们逐一允许单个非确定性来源影响我们原本确定性的实现,并度量每个来源对性能方差的影响。我们发现单个非确定性来源会显著影响智能体性能,说明了确定性实现的益处。此外,我们还讨论了确定性实现在实现结果精确可复现方面的重要作用。
引用
@article{arxiv.1809.05676,
title = {Deterministic Implementations for Reproducibility in Deep Reinforcement Learning},
author = {Prabhat Nagarajan and Garrett Warnell and Peter Stone},
journal= {arXiv preprint arXiv:1809.05676},
year = {2019}
}
备注
17 Pages