基于变批量训练的 L-Game 深度 Q-Learning 智能体
机器学习
2018-02-20 v1 人工智能
摘要
我们采用带有经验回放(Experience Replay)的深度 Q-Learning 算法来训练一个智能体,该智能体能够在低维状态下自我学习,并在 L-Game 中实现高水平对弈。我们还采用可变批量大小进行训练,以减轻稀有奖励信号的损失并显著加速训练。尽管由于可能的走法数量导致动作空间巨大,且状态空间低维、奖励稀少(仅在游戏结束时出现),DQL 仍成功训练出无需使用任何搜索方法或领域知识即可进行强力对弈的智能体。
引用
@article{arxiv.1802.06225,
title = {A Deep Q-Learning Agent for the L-Game with Variable Batch Training},
author = {Petros Giannakopoulos and Yannis Cotronis},
journal= {arXiv preprint arXiv:1802.06225},
year = {2018}
}