中文

线性无偏评估中覆盖性统一视角

机器学习 2026-01-28 v1 人工智能 机器学习

摘要

无偏评估(OPE)是强化学习(RL)中的一个基本任务。在经典的线性OPE设置中,有限样本保证常以 评估误差poly(Cπ,d,1/n,log(1/δ)), \text{评估误差} \le \text{poly}(C^\pi, d, 1/n,\log(1/\delta)), 的形式出现,其中d是特征维数,C^\pi是覆盖参数, characterize所访问特征在数据分布范围内是否落在特征子空间中。尽管这些保证在更强假设(例如Bellman完备性)下,对几个流行算法都有良好理解,但在仅target value function在特征中线性可实现的最简设置下,理解仍不足且碎片化。尽管最近有兴趣对该设置下统计率进行紧致表征,但正确的覆盖性概念仍不清晰,来自 prior分析的候选定义具有不可取的性质,与文献中更标准的定义格格不入。我们对该设置中一个标准算法LSTDQ进行了新的有限样本分析。受工具变量视角的启发,我们开发的误差界限依赖于一种新型覆盖参数,称为特征动力学覆盖性,它可解释为特征演化所诱导的动力系统中的线性覆盖。 在进一步的假设下——例如Bellman完备性——我们的定义成功恢复了这些设置下的专用覆盖参数,最终为线性OPE中的覆盖性提供了统一的理解。

关键词

引用

@article{arxiv.2601.19030,
  title  = {A Unifying View of Coverage in Linear Off-Policy Evaluation},
  author = {Philip Amortila and Audrey Huang and Akshay Krishnamurthy and Nan Jiang},
  journal= {arXiv preprint arXiv:2601.19030},
  year   = {2026}
}

备注

To appear at ICLR 2026