中文

利用 $Q$ 条件最大化弥合时序差学习与监督学习之间的差距

机器学习 2025-09-12 v3

摘要

近期,监督学习(SL)方法因其简单性、稳定性和高效性,已成为离线强化学习(RL)的一种有效方法。然而,近期研究表明,SL方法缺乏通常与基于时序差分(TD)方法相关的轨迹拼接能力。一个自然产生的问题是:\textit{如何赋予SL方法拼接能力,从而弥合其与TD学习之间的性能差距?}为回答这一问题,我们引入了用于离线目标条件RL的 QQ 条件最大化监督学习,通过 QQ 条件策略和 QQ 条件最大化增强了SL的拼接能力。具体而言,我们提出了 \textbf{G}oal-\textbf{C}onditioned \textbf{\textit{Rein}}forced \textbf{S}upervised \textbf{L}earning (\textbf{GC\textit{Rein}SL}),其包含:(1) 利用归一化流从离线数据集中估计 QQ 函数;(2) 通过将 QQ 函数最大化与期望回归相结合,在数据支持范围内寻找最大 QQ 值。在推理阶段,我们的策略基于该最大 QQ 值选择最优动作。在离线RL数据集上的拼接评估实验结果表明,我们的方法优于先前具备拼接能力的SL方法及目标数据增强技术。

关键词

引用

@article{arxiv.2506.00795,
  title  = {Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization},
  author = {Xing Lei and Zifeng Zhuang and Shentao Yang and Sheng Xu and Yunhao Luo and Fei Shen and Wenyan Yang and Xuetao Zhang and Donglin Wang},
  journal= {arXiv preprint arXiv:2506.00795},
  year   = {2025}
}