用于离策略预测的重要性重采样
机器学习
2019-11-15 v2 人工智能
机器学习
摘要
重要性采样(IS)是强化学习中离策略预测的一种常见重加权策略。虽然它是一致且无偏的,但可能导致价值函数权重的高方差更新。本文探索了一种重采样策略作为重加权的替代方案。我们提出用于离策略预测的重要性重采样(IR),该方法从经验回放缓冲区中重采样经验并应用标准的在策略更新。该方法避免在更新中使用重要性采样比率,而是在更新前修正分布。我们刻画了IR的偏差和一致性,特别是与加权IS(WIS)的比较。我们在多个微世界中证明,与IS及若干方差缩减IS策略(包括截断IS比率的WIS变体和V-trace)相比,IR具有更高的样本效率和更低的方差更新。我们还提供了一个演示,展示在赛车模拟器中从图像学习价值函数时,IR相比IS有所改进。
引用
@article{arxiv.1906.04328,
title = {Importance Resampling for Off-policy Prediction},
author = {Matthew Schlegel and Wesley Chung and Daniel Graves and Jian Qian and Martha White},
journal= {arXiv preprint arXiv:1906.04328},
year = {2019}
}
备注
Recently published in NeurIPS 2019