线性无偏评估中覆盖性统一视角
机器学习
2026-01-28 v1 人工智能
机器学习
摘要
无偏评估(OPE)是强化学习(RL)中的一个基本任务。在经典的线性OPE设置中,有限样本保证常以 的形式出现,其中d是特征维数,C^\pi是覆盖参数, characterize所访问特征在数据分布范围内是否落在特征子空间中。尽管这些保证在更强假设(例如Bellman完备性)下,对几个流行算法都有良好理解,但在仅target value function在特征中线性可实现的最简设置下,理解仍不足且碎片化。尽管最近有兴趣对该设置下统计率进行紧致表征,但正确的覆盖性概念仍不清晰,来自 prior分析的候选定义具有不可取的性质,与文献中更标准的定义格格不入。我们对该设置中一个标准算法LSTDQ进行了新的有限样本分析。受工具变量视角的启发,我们开发的误差界限依赖于一种新型覆盖参数,称为特征动力学覆盖性,它可解释为特征演化所诱导的动力系统中的线性覆盖。 在进一步的假设下——例如Bellman完备性——我们的定义成功恢复了这些设置下的专用覆盖参数,最终为线性OPE中的覆盖性提供了统一的理解。
引用
@article{arxiv.2601.19030,
title = {A Unifying View of Coverage in Linear Off-Policy Evaluation},
author = {Philip Amortila and Audrey Huang and Akshay Krishnamurthy and Nan Jiang},
journal= {arXiv preprint arXiv:2601.19030},
year = {2026}
}
备注
To appear at ICLR 2026