部分可观察环境中用于强化学习的神经架构经验比较
神经与进化计算
2015-12-18 v1 人工智能
机器学习
摘要
本文探讨了在若干部分可观察环境中,使用三种循环神经网络架构:Long Short-Term Memory、Gated Recurrent Unit和MUT1(一种从数千候选架构池中进化出的循环神经架构)进行强化学习的拟合神经Q迭代的性能。同时探讨了基于优势值而非Q值的拟合Q迭代变体。结果表明,对于所考虑的大多数问题,GRU比LSTM和MUT1性能显著更好,在学习到非常好的策略前需要更少的训练回合和更少的CPU时间。优势学习也往往产生更好的结果。
引用
@article{arxiv.1512.05509,
title = {An Empirical Comparison of Neural Architectures for Reinforcement Learning in Partially Observable Environments},
author = {Denis Steckelmacher and Peter Vrancx},
journal= {arXiv preprint arXiv:1512.05509},
year = {2015}
}
备注
Presented at the 27th Benelux Conference on Artificial Intelligence