中文

部分可观察环境中用于强化学习的神经架构经验比较

神经与进化计算 2015-12-18 v1 人工智能 机器学习

摘要

本文探讨了在若干部分可观察环境中,使用三种循环神经网络架构:Long Short-Term Memory、Gated Recurrent Unit和MUT1(一种从数千候选架构池中进化出的循环神经架构)进行强化学习的拟合神经Q迭代的性能。同时探讨了基于优势值而非Q值的拟合Q迭代变体。结果表明,对于所考虑的大多数问题,GRU比LSTM和MUT1性能显著更好,在学习到非常好的策略前需要更少的训练回合和更少的CPU时间。优势学习也往往产生更好的结果。

关键词

引用

@article{arxiv.1512.05509,
  title  = {An Empirical Comparison of Neural Architectures for Reinforcement Learning in Partially Observable Environments},
  author = {Denis Steckelmacher and Peter Vrancx},
  journal= {arXiv preprint arXiv:1512.05509},
  year   = {2015}
}

备注

Presented at the 27th Benelux Conference on Artificial Intelligence