可实现性与部分覆盖条件下的离线极小极大软 Q 学习
机器学习
2023-11-14 v2 机器学习
摘要
在离线强化学习(RL)中,我们没有机会进行探索,因此必须假设数据足以指导选择好的策略,通常表现为假设某种覆盖性、可实现性、贝尔曼完备性和/或硬间隔(差距)。本文提出了在仅部分覆盖条件下具有 PAC 保证的基于价值的离线 RL 算法,具体而言,仅覆盖单一比较器策略,并假设该单一策略的软(熵正则化)Q 函数以及一个定义为某极小极大优化问题鞍点的相关函数具有可实现性。这为离线 RL 提供了更精细且通常更宽松的条件。我们进一步在软间隔条件下展示了普通 Q 函数的类似结果。为获得这些保证,我们利用新颖的极小极大学习算法,以 收敛保证精确估计软 Q 函数或普通 Q 函数。我们的算法损失函数源于将估计问题转化为非线性凸优化问题并进行拉格朗日松弛。
引用
@article{arxiv.2302.02392,
title = {Offline Minimax Soft-Q-learning Under Realizability and Partial Coverage},
author = {Masatoshi Uehara and Nathan Kallus and Jason D. Lee and Wen Sun},
journal= {arXiv preprint arXiv:2302.02392},
year = {2023}
}
备注
The original title of this paper was "Refined Value-Based Offline RL under Realizability and Partial Coverage," but it was later changed. This paper has been accepted for NeurIPS 2023