中文

深度强化学习权重的自适应同步方法

机器学习 2020-08-18 v1 机器学习

摘要

Deep Q-Networks (DQN) 是最著名的深度强化学习方法之一,其使用深度学习来近似动作值函数。解决众多深度强化学习挑战(如移动目标问题与样本间相关性)是该模型的主要优势。尽管近年来出现了 DQN 的多种扩展,它们均采用与 DQN 类似的方法克服移动目标问题。尽管有上述优势,以固定步长同步网络权重且独立于智能体行为,在某些情况下可能导致某些已良好学习的网络丢失。这些丢失的网络可能导向奖励更多的状态,从而在回放记忆中存储更好的样本以供未来训练。本文针对 DQN 系列的这一为题,提出一种用于 DQN 中神经网络权重同步的自适应方法。该方法中,权重同步基于智能体近期行为完成,行为由区间结束时某一准则度量。为验证该方法,我们将 DQN 与 rainbow 方法调整为采用所提自适应同步方法。我们在知名游戏上将这些调整方法与标准形式比较,结果证实了我们的同步方法的质量。

关键词

引用

@article{arxiv.2008.06973,
  title  = {An adaptive synchronization approach for weights of deep reinforcement learning},
  author = {S. Amirreza Badran and Mansoor Rezghi},
  journal= {arXiv preprint arXiv:2008.06973},
  year   = {2020}
}