离线强化学习中的泛化:结构比悲观程度更重要
机器学习
2026-07-02 v1 人工智能
摘要
虽然悲观主义抵消了离线强化学习(RL)中的过估计偏差,但过度保守与阻碍某些形式的泛化有关。然而,在本文中,我们证明了过度悲观并不固有地阻止上下文MDP(CMDP)中的最优泛化。相反,我们认为成功的泛化不取决于悲观的程度,而取决于悲观结构是否尊重最优解的潜在对称性。我们证明了一个轻度悲观的、非对称的值函数可能比一个过度悲观的、对称的值函数泛化得更差。在离线RL中,悲观的结构由数据集覆盖的结构决定。因此,强制对称值函数可能是不平凡的,并且可能需要诸如数据增强(DA)之类的技术。受我们理论结果的启发,我们认为DA最好通过在策略提取期间的一致性损失来应用,而不是在增强数据集上进行(常规)离线训练的常见做法。这在旋转对称的reacher环境中使用IQL和CQL进行了实证验证。
引用
@article{arxiv.2607.02288,
title = {Generalization in offline RL: The structure is more important than the amount of pessimism},
author = {Max Weltevrede and Matthijs T. J. Spaan and Wendelin Böhmer},
journal= {arXiv preprint arXiv:2607.02288},
year = {2026}
}