少即是多:用于离线强化学习的聚类交叉协方差控制
机器学习
2026-02-03 v2
摘要
离线强化学习中的一个基本挑战是分布偏移。稀疏数据或由分布外 (OOD) 区域主导的数据集会加剧这个问题。我们的理论分析和实验表明,标准平方误差目标会诱导有害的 TD 交叉协方差。这种效应在 OOD 区域被放大,使优化产生偏差并降低策略学习效果。为了抵消这种机制,我们开发了两种互补策略:分区缓冲采样,它将更新限制在局部重放分区内,减弱不规则的协方差效应,并对齐更新方向,从而产生一种易于与现有实现集成的方案,即用于 TD 的聚类交叉协方差控制 (C^4)。我们还引入了一个显式的基于梯度的修正惩罚项,以消除每次更新中由协方差引起的偏差。我们证明了缓冲分区保留了最大化目标的下界性质,并且这些约束减轻了极端 OOD 区域中的过度保守性,而不会改变策略约束的离线强化学习的核心行为。实验上,我们的方法展示了更高的稳定性,并且与先前方法相比,回报提高了高达 30%,尤其是在小数据集和强调 OOD 区域的分割情况下。
引用
@article{arxiv.2601.20765,
title = {Less is More: Clustered Cross-Covariance Control for Offline RL},
author = {Nan Qiao and Sheng Yue and Shuning Wang and Yongheng Deng and Ju Ren},
journal= {arXiv preprint arXiv:2601.20765},
year = {2026}
}
备注
accepted by ICLR 2026