中文

通过深度网络集成降低时序差分价值估计的方差

机器学习 2022-09-19 v1

摘要

在时序差分强化学习算法中,价值估计的方差会导致不稳定性以及对最大目标价值的过高估计。已有许多算法被提出以降低过高估计,包括若干近期的集成方法,然而尚无方法通过解决估计方差这一过高估计的根本原因,在样本高效学习上取得成功。本文提出 MeanQ,一种将目标价值估计为集成均值的简单集成方法。尽管简单,MeanQ 在 Atari Learning Environment 基准上的实验中展现出卓越的样本效率。重要的是,我们发现大小为 5 的集成足以降低估计方差,从而无需滞后的目标网络,消除其作为偏差来源并进一步提升样本效率。我们从直观和实证上论证了 MeanQ 中的设计选择,包括独立经验采样的必要性。在 26 个基准 Atari 环境集合中,MeanQ 在 100K 交互步时在 16/26 个环境中优于所有被测基线,包括最佳可用基线 SUNRISE,平均高出 68%。MeanQ 在 500K 步时也在 21/26 个环境中优于 Rainbow DQN,平均高出 49%,并使用 200K(±\pm100K)交互步达到平均人类水平性能。我们的实现位于 https://github.com/indylab/MeanQ。

关键词

引用

@article{arxiv.2209.07670,
  title  = {Reducing Variance in Temporal-Difference Value Estimation via Ensemble of Deep Networks},
  author = {Litian Liang and Yaosheng Xu and Stephen McAleer and Dailin Hu and Alexander Ihler and Pieter Abbeel and Roy Fox},
  journal= {arXiv preprint arXiv:2209.07670},
  year   = {2022}
}