中文

离线策略评估中线性估计量的完全刻画

机器学习 2022-12-20 v2 机器学习

摘要

离线策略评估是强化学习中的一个基本统计问题,涉及在给定由可能不同的策略所收集数据的情况下,估计某个决策策略的价值函数。为了处理具有复杂高维观测的问题,理论研究者与实践者都对理解强化学习中函数逼近的可能性表现出显著兴趣。尽管已有大量研究,但即便在最简单的线性函数逼近设定下,我们何时可以期望离线策略评估是易处理的,至今仍不明确,近期文献中出现了数量惊人的强负面结果。在本工作中,我们识别出经典方法(特别是Fitted Q-iteration(FQI)和最小二乘时序差分学习(LSTD))在离线策略评估中取得成功所必需且充分的控制论与线性代数条件。利用该刻画,我们建立了这些估计量取得成功的精确条件层级。我们证明LSTD在比FQI更弱的条件下工作。此外,我们确立若某问题无法通过LSTD求解,则它不能被一类广泛的线性估计量求解,即便在无限数据极限下也是如此。综上,我们的结果提供了离线策略评估中线性估计量行为的完整图景,统一了先前对典型算法的分散分析,并给出了离线策略评估底层统计复杂度的更尖锐刻画。

关键词

引用

@article{arxiv.2203.04236,
  title  = {A Complete Characterization of Linear Estimators for Offline Policy Evaluation},
  author = {Juan C. Perdomo and Akshay Krishnamurthy and Peter Bartlett and Sham Kakade},
  journal= {arXiv preprint arXiv:2203.04236},
  year   = {2022}
}

备注

added extensions to misspecified case, comparisons to Bellman residual minimization, 41 pages