中文

软 Q 网络

机器学习 2020-12-15 v2 人工智能

摘要

深度 Q 网络(DQN)是一种非常成功的算法,但强化学习的固有问题,即利用-探索平衡,依然存在。本工作中,我们将熵正则化引入 DQN 并提出 SQN。我们发现,若将软备份视为以 Q 形式进行的策略改进而非策略评估,则软 Q 学习的备份方程可享有校正反馈。我们表明,带校正反馈的软 Q 学习(SQL-CF)揭示了 SQL 的 on-policy 本质以及 SQL 与软策略梯度(SPG)的等价性。基于这些见解,我们提出了深度 Q 学习算法的 on-policy 版本,即 Q On-Policy(QOP)。我们在名为 Google Research Football(GRF)的自博弈环境中对 QOP 进行了实验。QOP 算法在训练 GRF 智能体时表现出极佳的稳定性和效率。

关键词

引用

@article{arxiv.1912.10891,
  title  = {Soft Q Network},
  author = {Jingbin Liu and Shuai Liu and Xinyang Gu},
  journal= {arXiv preprint arXiv:1912.10891},
  year   = {2020}
}