中文

Bootstrapped DQN 中的多步回报混合

机器学习 2020-07-17 v1 人工智能 机器学习

摘要

利用多步回报更新值函数的概念已在深度强化学习(DRL)中采用多年。使用不同备份长度更新值函数在不同方面具有优势,包括值估计的偏差与方差、收敛速度以及智能体的探索行为。TD-lambda 等传统方法通过使用等价于不同步回报指数平均的目标值来利用这些优势。然而,将步回报整合为单一目标牺牲了不同步回报目标所提供优势的差异性。为解决此问题,我们提出构建于 bootstrapped DQN 之上的 Mixture Bootstrapped DQN(MB-DQN),并对不同的 bootstrapped heads 使用不同的备份长度。MB-DQN 实现了仅依赖单一目标值的方法所无法具备的目标值异质性。因此,它能够保持不同备份长度所提供的优势。本文首先通过简单迷宫环境讨论动机洞察。为验证 MB-DQN 的有效性,我们在 Atari 2600 基准环境中进行实验,并展示 MB-DQN 相对于若干基线方法的性能提升。我们进一步提供一组消融研究以检验 MB-DQN 不同设计配置的影响。

关键词

引用

@article{arxiv.2007.08229,
  title  = {Mixture of Step Returns in Bootstrapped DQN},
  author = {Po-Han Chiang and Hsuan-Kung Yang and Zhang-Wei Hong and Chun-Yi Lee},
  journal= {arXiv preprint arXiv:2007.08229},
  year   = {2020}
}