中文

基于可微函数逼近器的离线策略拟合 Q 评估:Z 估计与推断理论

机器学习 2022-02-11 v1 机器学习

摘要

离线策略评估 (OPE) 是强化学习 (RL) 的基石之一。采用各种函数逼近器(尤其是深度神经网络)的拟合 Q 评估 (FQE) 已在实践中取得成功。尽管统计分析已证明 FQE 在表格型、线性及若干非参数函数族下具有极小极大最优性,但其在更一般的函数逼近器下的实际性能在理论上尚不明确。我们聚焦于采用一般可微函数逼近器的 FQE,使我们的理论适用于神经函数逼近。我们利用 Z 估计理论处理该问题,并建立了以下结果:FQE 估计误差是渐近正态的,其显式方差由函数类在真实值处的切空间、奖励结构以及离线策略学习导致的分布偏移共同决定;有限样本 FQE 误差界由同一方差项主导,并且也可由依赖于函数类的散度界定,该散度衡量了离线策略分布偏移与函数逼近器如何相互交织。此外,我们研究了用于误差分布推断和置信区间估计的自助法 FQE 估计量,并给出了与我们的上界相匹配的 Cramér-Rao 下界。Z 估计分析为研究 RL 中的离线策略估计提供了一个可推广的理论框架,并为使用可微函数逼近器的 FQE 提供了精确的统计理论。

关键词

引用

@article{arxiv.2202.04970,
  title  = {Off-Policy Fitted Q-Evaluation with Differentiable Function Approximators: Z-Estimation and Inference Theory},
  author = {Ruiqi Zhang and Xuezhou Zhang and Chengzhuo Ni and Mengdi Wang},
  journal= {arXiv preprint arXiv:2202.04970},
  year   = {2022}
}

备注

39 pages