中文

基于情景式反向更新的样本高效深度强化学习

机器学习 2019-11-13 v3 机器学习

摘要

我们提出情景式反向更新(EBU)——一种具有直接价值传播的新颖深度强化学习算法。与经验回放均匀随机采样的常规用法不同,我们的智能体采样整条情景并依次将一个状态的价值传播至其先前状态。我们计算高效的递归算法允许稀疏且延迟的奖励通过所采样情景的所有转移直接传播。我们从理论上证明了EBU方法的收敛性,并通过实验展示了其在确定性与随机环境中的性能。尤其在Atari 2600领域的49款游戏中,EBU仅分别使用5%和10%的样本便达到了与DQN相同的人类归一化平均和中位数性能。

关键词

引用

@article{arxiv.1805.12375,
  title  = {Sample-Efficient Deep Reinforcement Learning via Episodic Backward Update},
  author = {Su Young Lee and Sungik Choi and Sae-Young Chung},
  journal= {arXiv preprint arXiv:1805.12375},
  year   = {2019}
}

备注

NeurIPS 2019