面向通用值函数的统一离策略评估方法
机器学习
2021-07-07 v1 人工智能
统计理论
统计理论
摘要
通用值函数(General Value Function, GVF)是表示强化学习(RL)中{\em 预测}与{\em 回溯}知识的强大工具。在实践中,常常需要用预先收集的离策略样本联合评估多个相互关联的GVF。文献中采用梯度时序差分(GTD)学习方法来在离策略设定下评估GVF,但即便函数逼近类具有充分表达能力,此类方法也可能存在较大估计误差。此外,先前工作均未在函数逼近设定下正式建立收敛到真实GVF的保证。本文通过一类具有因果滤波的GVF的视角解决上述两个问题,其涵盖广泛的RL应用,如奖励方差、值梯度、异常检测中的代价、平稳分布梯度等。我们提出一种称为GenTD的新算法用于离策略GVF评估,并表明GenTD能像学习单个标准标量值函数一样高效地学习多个相互关联的多维GVF。我们进一步表明,与GTD不同,只要函数逼近能力足够大,GenTD学到的GVF保证收敛到真实GVF。据我们所知,GenTD是首个具有全局最优性保证的离策略GVF评估算法。
引用
@article{arxiv.2107.02711,
title = {A Unified Off-Policy Evaluation Approach for General Value Function},
author = {Tengyu Xu and Zhuoran Yang and Zhaoran Wang and Yingbin Liang},
journal= {arXiv preprint arXiv:2107.02711},
year = {2021}
}
备注
submitted for publication