中文

分层经验回放:纠正离策略强化学习中的多重性偏差

机器学习 2021-02-24 v1 人工智能

摘要

深度强化学习(RL)方法依赖经验回放来近似小批量监督学习设定;然而,与需要大量训练数据以促进泛化的监督学习不同,基于回放的深度 RL 似乎在存在多余数据时表现不佳。近期工作表明,当 Deep Q-Network (DQN) 的回放内存过大时,其性能会下降。这表明过时经验会以某种方式影响深度 RL 的性能,而对于 DQN 这类离策略方法本不应如此。因此,我们重新审视在回放内存上均匀采样的动机,发现其在使用函数逼近时可能存在缺陷。我们证明——尽管与传统认知相反——从均匀分布中采样并不能产生不相关的训练样本,从而在训练过程中使梯度产生偏差。我们的理论给出了一种特殊非均匀分布以抵消该效应,并提出了一种分层采样方案来高效实现它。

关键词

引用

@article{arxiv.2102.11319,
  title  = {Stratified Experience Replay: Correcting Multiplicity Bias in Off-Policy Reinforcement Learning},
  author = {Brett Daley and Cameron Hickert and Christopher Amato},
  journal= {arXiv preprint arXiv:2102.11319},
  year   = {2021}
}

备注

AAMAS 2021 Extended Abstract, 3 pages, 3 figures