中文

生成式 OOD 正则化基于策略优化的模型

机器学习 2026-05-26 v1 人工智能

摘要

我们研究了基于离线强化学习 (RL) 的顺序决策问题。传统的离线 RL 策略在仅依赖稀疏离线表示进行训练时,可能导致产生超出分布 (OOD) 的动作。为确保稀疏状态-动作空间中的安全离线策略,我们探索了如何将密度估计模型集成到基于模型的 RL 方法中以避免 OOD 区域。生成式模型能够显式地建模稀疏状态-动作空间中的密度。基于此,我们引入了生成式 OOD 正则化模型策略优化 (GORMPO),这是一种使用生成式密度建模将策略更新限制在数据集高密度区域的密度正则化离线 RL 算法。此外,我们检验了更好的 OOD 检测是否对应更好的基于模型的离线策略。我们在真实医疗数据集和稀疏离线 RL 数据集上比较 (1) 各种密度估计器的 OOD 检测能力以及 (2) 它们在 GORMPO 框架中的性能。我们在温和假设下理论保证 GORMPO 的性能。实验上,GORMPO 在真实医疗数据集上比最先进的基线提高了 17%,并在离线 RL 数据集上提升了基本模型。我们的实证发现表明,在动态稳定的环境中,更好的 OOD 检测通常会导致改进的策略,而在动态不确定的情况下,更保守的惩罚更受青睐。

关键词

引用

@article{arxiv.2605.24405,
  title  = {Generative OOD-regularized Model-based Policy Optimization},
  author = {Aysin Tumay and Jiahe Huang and Elise Jortberg and Rose Yu},
  journal= {arXiv preprint arXiv:2605.24405},
  year   = {2026}
}