ViZDoom:采用优先经验回放、Double-Q学习与快照集成的DRQN
人工智能
2018-01-04 v1
摘要
ViZDoom是一个鲁棒的第一人称射击强化学习环境,其特征是具有相当程度的潜在状态信息。本文中,在特定的ViZDoom战斗场景下,使用一种具有竞争力的深度循环Q网络(DRQN)架构测试了double-Q学习与优先经验回放方法。此外,采用一种称为快照集成的集成技术,并使用特定的退火学习率,以观察这两种方法下集成效能的差异。退火学习率通常对深度神经网络模型的训练十分重要,因为它们打破现状并抵消模型趋向局部最优的趋势。尽管两种变体均表现出超越游戏内置AI智能体的性能,但double-Q学习已知的稳定效应得到了印证,且优先经验回放通过展示智能体开发早期的即时结果再次验证了其效用,但需注意此情况下价值高估被加速。此外,观察到优先经验回放(PER)与double-Q(DDQ)变体发展出一些独特行为,且PER与DDQ的快照集成被证明是提升ViZDoom Marine性能的一种有价值方法。
引用
@article{arxiv.1801.01000,
title = {ViZDoom: DRQN with Prioritized Experience Replay, Double-Q Learning, & Snapshot Ensembling},
author = {Christopher Schulze and Marcus Schulze},
journal= {arXiv preprint arXiv:1801.01000},
year = {2018}
}
备注
9 pages, 5 figures