中文

离散到深度监督策略学习

机器学习 2020-05-06 v1 机器学习

摘要

神经网络是有效的函数逼近器,但在强化学习 (RL) 背景下难以训练,主要原因是样本具有相关性。多年来,学者们通过使用经验回放或异步并行智能体系统来规避这一问题。本文提出了用于强化学习中训练神经网络的离散到深度监督策略学习 (D2D-SPL)。D2D-SPL 将连续状态空间离散化为离散状态,并使用 Actor-Critic 学习策略。然后,它从每个离散状态中选择一个输入值以及具有最高数值偏好的动作作为输入/目标对。最后,它使用来自所有离散状态的输入/目标对来训练一个分类器。D2D-SPL 使用单个智能体,无需经验回放,并且学习速度比最先进的方法快得多。我们在两个强化学习环境中测试了我们的方法:Cartpole 和一个飞机机动模拟器。

关键词

引用

@article{arxiv.2005.02057,
  title  = {Discrete-to-Deep Supervised Policy Learning},
  author = {Budi Kurniawan and Peter Vamplew and Michael Papasimeon and Richard Dazeley and Cameron Foale},
  journal= {arXiv preprint arXiv:2005.02057},
  year   = {2020}
}

备注

9 pages, 9 figures. Adaptive and Learning Agents Workshop at AAMAS 2020, Auckland, New Zealand