关于带有 $Q^\star$ -近似和部分覆盖的离线强化学习复杂度
机器学习
2026-02-13 v1 人工智能
机器学习
摘要
我们研究了离线强化学习中的 -近似和部分覆盖问题,这一设定激发了诸如保守Q学习(CQL;Kumar 等,2020)等实用算法,但在理论上获得了有限的关注。我们的工作受到以下开放问题的启发:“在部分覆盖的情况下, -可实现性和贝尔曼完整性是否足以实现样本高效的离线强化学习?”我们以否定答案回答了这个问题,通过建立信息论下界。进一步地,我们引入了一个通用框架,用以刻画给定 函数类的内在复杂度,灵感来自面向在线强化学习的模型无决策-估计系数(DEC;Foster 等,2023b;Liu 等,2025b)。这种复杂度恢复并改进了Chen和Jiang(2022)和Uehara等(2023)所依赖的量,并扩展到更广泛的设置。我们的决策-估计分解可以与各种 估计方法结合,模块化和泛化现有方法。除上述通用框架外,我们还作出了进一步贡献:通过发展一种新型的二阶性能差不等式,我们获得了软Q学习在部分覆盖下首个 样本复杂度,改进了Uehara等(2023)的 界限。我们消除了Chen和Jiang(2022)在 价值间隙未知时需要额外在线交互的限制。我们还给出了面向一般低贝尔曼秩MDP的离线可学习性首次表述,这一在线RL中常见的设定在离线RL中除特殊情况外尚未探索。最后,我们提供了在 -可实现性和贝尔曼完整性下,对CQL进行表格以外的首次分析。
引用
@article{arxiv.2602.12107,
title = {On the Complexity of Offline Reinforcement Learning with $Q^\star$-Approximation and Partial Coverage},
author = {Haolin Liu and Braham Snyder and Chen-Yu Wei},
journal= {arXiv preprint arXiv:2602.12107},
year = {2026}
}