中文

通过考虑过往决策提升离屏强化学习的效率

机器学习 2021-12-24 v1

摘要

基于多步回报的离屏学习对于样本高效的强化学习至关重要,尤其在当前与深度神经网络结合使用的经验回放设定中。经典地,离屏估计偏差以每决策方式修正:过去的时序差分误差在每次动作后由瞬时重要性采样(IS)比(经由资格迹)重新加权。许多重要的离屏算法如Tree Backup与Retrace依赖此机制及不同的比率(“迹”)截断(“切割”)协议,以抵消IS估计器的过度方差。不幸的是,基于每决策切割迹未必高效;一旦迹依据局部信息被切割,该效应无法在后续逆转,可能导致估计回报的过早截断与更慢的学习。为激励高效离屏算法,我们提出一种允许多任意过往依赖迹的多步算子。我们证明了我们的算子在策略评估时收敛,且在目标为极限贪婪策略的最优控制时亦收敛。我们的定理为许多现有算法(包括截断IS、非马尔可夫Retrace与历史依赖TD(λ\lambda))建立了首个收敛保证。我们的理论结果也为开发联合考虑多个过往决策以实现更好信用分配与更快学习的新算法提供了指导。

关键词

引用

@article{arxiv.2112.12281,
  title  = {Improving the Efficiency of Off-Policy Reinforcement Learning by Accounting for Past Decisions},
  author = {Brett Daley and Christopher Amato},
  journal= {arXiv preprint arXiv:2112.12281},
  year   = {2021}
}

备注

12 pages, 0 figures