中文

基于轨迹数据在有限时域离线强化学习中实现统计高效策略评估

机器学习 2025-10-07 v1 机器学习

摘要

我们研究了有限时域离线强化学习(RL)的函数逼近,用于策略评估和策略优化。先前的工作在仅假设数据具有良好覆盖(concentrability)和每个策略的状态-动作价值函数均可线性实现(qπq^\pi-realizability)的情况下,证明了对这两个问题都不可能实现统计上高效的学习(Foster等人,2021)。最近的工作(Tkachuk等人,2024)在假设数据以轨迹形式呈现的基础上,给出了一个 statistically 高效的策略优化学习器。在本文中,我们在相同假设下提出了一个 statistically 高效的策略评估学习器。进一步,我们表明, Tkachuk等人(2024)用于策略优化的学习器的样本复杂度可以通过更紧致的分析得到改进。

关键词

引用

@article{arxiv.2510.03494,
  title  = {Trajectory Data Suffices for Statistically Efficient Policy Evaluation in Finite-Horizon Offline RL with Linear $q^\pi$-Realizability and Concentrability},
  author = {Volodymyr Tkachuk and Csaba Szepesvári and Xiaoqi Tan},
  journal= {arXiv preprint arXiv:2510.03494},
  year   = {2025}
}