中文

深度强化学习中可复现性的确定性实现

人工智能 2019-06-11 v5

摘要

尽管深度强化学习(DRL)近年来取得了众多成功,但复现这些成功可能极具挑战性。与DRL特别相关的一个可复现性挑战是训练过程中的非确定性,其会显著影响结果。受此挑战启发,我们研究了确定性实现在消除训练中非确定性方面的积极作用。为此,我们考虑深度Q学习算法的具体案例,通过识别并控制训练过程中所有非确定性来源,构建其确定性实现。随后,我们逐一允许单个非确定性来源影响我们原本确定性的实现,并度量每个来源对性能方差的影响。我们发现单个非确定性来源会显著影响智能体性能,说明了确定性实现的益处。此外,我们还讨论了确定性实现在实现结果精确可复现方面的重要作用。

关键词

引用

@article{arxiv.1809.05676,
  title  = {Deterministic Implementations for Reproducibility in Deep Reinforcement Learning},
  author = {Prabhat Nagarajan and Garrett Warnell and Peter Stone},
  journal= {arXiv preprint arXiv:1809.05676},
  year   = {2019}
}

备注

17 Pages