第一人称射击环境中经验的最优利用
机器学习
2019-06-25 v1 机器学习
摘要
尽管强化学习近来取得了巨大进展,但其持续存在的局限是需要对环境进行极大量的交互。在本文中,我们探讨了在 Deep Q-Learning 算法中复用经验回放缓冲区中经验的有效性。我们在 VizDoom 环境中测试了每个环境步施加多次学习更新步的有效性,并首先表明这需要改变学习率,其次表明它并不能提升智能体的性能。此外,我们表明降低更新频率在 4:1 的比例内是有效的,超过该比例后性能显著下降。这些结果定量地证实了普遍采用的每第 4 个环境步执行学习更新的做法。
引用
@article{arxiv.1906.09734,
title = {Optimal Use of Experience in First Person Shooter Environments},
author = {Matthew Aitchison},
journal= {arXiv preprint arXiv:1906.09734},
year = {2019}
}