中文

在凸包及其邻域中具有平滑 OOD 泛化能力的离线强化学习

机器学习 2025-06-11 v1 人工智能

摘要

离线强化学习 (RL) 面临分布偏移的挑战,导致对分布外 (OOD) 动作的 QQ 值高估。现有方法通过施加约束来解决此问题;然而,它们在评估 OOD 区域时往往变得过于保守,这限制了 QQ 函数的泛化。这种过度约束问题导致 QQ 值估计不佳并阻碍策略改进。在本文中,我们引入了一种新方法,通过增强凸包及其邻域 (CHN) 内 OOD 区域的 QQ 函数泛化来实现更好的 QQ 值估计。在 CHN 的安全泛化保证下,我们提出了平滑 Bellman 算子 (SBO),它通过用相邻的样本内 QQ 值平滑 OOD QQ 值来更新它们。我们从理论上证明,SBO 可以近似 CHN 内样本内和 OOD 动作的真实 QQ 值。我们的实用算法平滑 QQ 函数 OOD 泛化 (SQOG) 在经验上缓解了过度约束问题,实现了近乎准确的 QQ 值估计。在 D4RL 基准测试中,SQOG 在性能和计算效率上均优于现有的 SOTA 方法。

关键词

引用

@article{arxiv.2506.08417,
  title  = {Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood},
  author = {Qingmao Yao and Zhichao Lei and Tianyuan Chen and Ziyue Yuan and Xuefan Chen and Jianxiang Liu and Faguo Wu and Xiao Zhang},
  journal= {arXiv preprint arXiv:2506.08417},
  year   = {2025}
}

备注

ICLR 2025