中文

第一人称射击环境中经验的最优利用

机器学习 2019-06-25 v1 机器学习

摘要

尽管强化学习近来取得了巨大进展,但其持续存在的局限是需要对环境进行极大量的交互。在本文中,我们探讨了在 Deep Q-Learning 算法中复用经验回放缓冲区中经验的有效性。我们在 VizDoom 环境中测试了每个环境步施加多次学习更新步的有效性,并首先表明这需要改变学习率,其次表明它并不能提升智能体的性能。此外,我们表明降低更新频率在 4:1 的比例内是有效的,超过该比例后性能显著下降。这些结果定量地证实了普遍采用的每第 4 个环境步执行学习更新的做法。

关键词

引用

@article{arxiv.1906.09734,
  title  = {Optimal Use of Experience in First Person Shooter Environments},
  author = {Matthew Aitchison},
  journal= {arXiv preprint arXiv:1906.09734},
  year   = {2019}
}