无需重要性采样比的多步离策略学习
机器学习
2017-02-13 v1
摘要
为了从探索性数据中估计策略的价值函数,大多数无模型离策略算法依赖于重要性采样,而重要性采样比的使用往往导致估计值具有严重方差。因此,希望在不使用比率的情况下进行离策略学习。然而,对于带有函数逼近的多步学习,这样的算法并不存在。在本文中,我们介绍了第一个基于时序差分学习更新的此类算法。我们表明,通过以动作依赖的方式改变TD更新中的自举量,可以消除对重要性采样比的显式使用。我们的新算法使用双时间尺度梯度基TD更新实现了稳定性。一种基于查找表表示的先前算法称为Tree Backup,也可以通过动作依赖自举恢复,成为我们算法的特例。在两个具有挑战性的离策略任务中,我们证明了我们的算法是稳定的,有效避免了大方差问题,并且可以比其最先进的对应算法表现更好。
引用
@article{arxiv.1702.03006,
title = {Multi-step Off-policy Learning Without Importance Sampling Ratios},
author = {Ashique Rupam Mahmood and Huizhen Yu and Richard S. Sutton},
journal= {arXiv preprint arXiv:1702.03006},
year = {2017}
}
备注
24 pages, 4 figures