TBQ($\sigma$):提升离策略强化学习中迹利用效率
机器学习
2019-05-20 v1 人工智能
机器学习
摘要
带有资格迹(eligibility traces)的离策略强化学习具有挑战性,因为目标策略与行为策略之间存在差异。一种常见方法是以概率方式度量两个策略的差异,例如重要性采样和树备份(tree-backup)。然而,现有的基于概率策略度量的离策略学习方法在贪婪目标策略下利用迹时效率低下,这对控制问题是无效的。当采取非贪婪动作时迹被立即截断,这可能丧失资格迹的优势并减慢学习过程。另一方面,一些非概率度量方法如 General Q() 和 Naive Q() 从不截断迹,但在实践中面临收敛问题。为解决上述问题,本文引入一种名为 TBQ() 的新方法,其有效统一了树备份算法与 Naive Q()。通过引入新参数 来刻画利用迹的\emph{程度},TBQ() 实现了 TB() 与 Naive Q() 的有效融合及二者间的连续角色切换。我们从理论上分析了 TB() 在策略评估与控制设置下的收缩性质。我们还推导了 TBQ() 的在线版本并给出收敛证明。我们通过实验表明,对于 -贪婪策略中 ,存在 下某种程度的迹利用,可提升离策略强化学习的迹利用效率,从而加速学习过程并改善性能。
引用
@article{arxiv.1905.07237,
title = {TBQ($\sigma$): Improving Efficiency of Trace Utilization for Off-Policy Reinforcement Learning},
author = {Longxiang Shi and Shijian Li and Longbing Cao and Long Yang and Gang Pan},
journal= {arXiv preprint arXiv:1905.07237},
year = {2019}
}
备注
8 pages