基于锐利感知最小化(SAM)提升离线强化学习在数据损坏情况下的鲁棒性
机器学习
2026-04-08 v1 人工智能
摘要
离线强化学习(RL)对真实世界数据损坏极其脆弱,即使是鲁棒算法在面对挑战性观测损坏和混合损坏时也会失败。我们认为,这种失败源于数据损坏导致损失景观中出现锐利极小值,从而引发泛化能力下降。为此,我们首次将锐利感知最小化(SAM)应用于离线RL,作为一种通用、可即插即用的优化器。SAM寻求更平滑的极小值,引导模型向更具鲁棒性的参数区域发展。我们将SAM集成到针对数据损坏的强基线算法中:IQL是该情境下表现突出的离线RL算法,RIQL则是专为数据损坏鲁棒性设计的算法。我们在D4RL基准上进行评估,包含随机损坏和对抗性损坏。我们的SAM增强方法在所有基线上均显著并持续地超越原始方法。奖励表面可视化 confirms that SAM找到了更平滑的解,为其在提升离线RL智能体鲁棒性方面的有效性提供了有力证据。
引用
@article{arxiv.2511.17568,
title = {Enhancing Robustness of Offline Reinforcement Learning Under Data Corruption via Sharpness-Aware Minimization},
author = {Le Xu and Jiayu Chen},
journal= {arXiv preprint arXiv:2511.17568},
year = {2026}
}
备注
Accepted as an Oral Presentation at the AAAI 2026 Student Abstract and Poster Program (SAPP)