中文

关于带有 $Q^\star$ -近似和部分覆盖的离线强化学习复杂度

机器学习 2026-02-13 v1 人工智能 机器学习

摘要

我们研究了离线强化学习中的 QQ^\star -近似和部分覆盖问题,这一设定激发了诸如保守Q学习(CQL;Kumar 等,2020)等实用算法,但在理论上获得了有限的关注。我们的工作受到以下开放问题的启发:“在部分覆盖的情况下,QQ^\star -可实现性和贝尔曼完整性是否足以实现样本高效的离线强化学习?”我们以否定答案回答了这个问题,通过建立信息论下界。进一步地,我们引入了一个通用框架,用以刻画给定 QQ^\star 函数类的内在复杂度,灵感来自面向在线强化学习的模型无决策-估计系数(DEC;Foster 等,2023b;Liu 等,2025b)。这种复杂度恢复并改进了Chen和Jiang(2022)和Uehara等(2023)所依赖的量,并扩展到更广泛的设置。我们的决策-估计分解可以与各种 QQ^\star 估计方法结合,模块化和泛化现有方法。除上述通用框架外,我们还作出了进一步贡献:通过发展一种新型的二阶性能差不等式,我们获得了软Q学习在部分覆盖下首个 ϵ2\epsilon^{-2} 样本复杂度,改进了Uehara等(2023)的 ϵ4\epsilon^{-4} 界限。我们消除了Chen和Jiang(2022)在 QQ^\star 价值间隙未知时需要额外在线交互的限制。我们还给出了面向一般低贝尔曼秩MDP的离线可学习性首次表述,这一在线RL中常见的设定在离线RL中除特殊情况外尚未探索。最后,我们提供了在 QQ^\star -可实现性和贝尔曼完整性下,对CQL进行表格以外的首次分析。

关键词

引用

@article{arxiv.2602.12107,
  title  = {On the Complexity of Offline Reinforcement Learning with $Q^\star$-Approximation and Partial Coverage},
  author = {Haolin Liu and Braham Snyder and Chen-Yu Wei},
  journal= {arXiv preprint arXiv:2602.12107},
  year   = {2026}
}