无显式保守性的长时序基于模型的离线强化学习
机器学习
2026-05-04 v3
摘要
流行的离线强化学习(RL)方法依赖显式保守性,对数据集外动作进行惩罚或限制展开时序。我们质疑这一原则的普适性,并重新审视一种互补的贝叶斯视角用于测试时适应。通过对世界模型的后验进行建模并训练一个依赖历史的智能体以最大化期望回报,贝叶斯方法直接处理认知不确定性而无需显式保守性。我们首先在多臂赌博机设置中证明,在低质量数据集上贝叶斯方法优于保守性方法失效的场景。扩展到真实任务后,我们发现去除保守性后长时序展开对于控制价值高估至关重要。我们引入了使长时序展开学习成为可能同时缓解复合模型误差的设计选择,得到了基于中性贝叶斯原理的算法 NEUBAY。在 D4RL 和 NeoRL 基准测试上,NEUBAY 与领先的保守性算法具有竞争力,在展开时序为数百步的 7 个数据集上取得了新的最先进性能。最后,我们根据数据质量和覆盖度对数据集进行表征,以确定何时 NEUBAY 优于保守性方法。
引用
@article{arxiv.2512.04341,
title = {Long-Horizon Model-Based Offline Reinforcement Learning Without Explicit Conservatism},
author = {Tianwei Ni and Esther Derman and Vineet Jain and Vincent Taboga and Siamak Ravanbakhsh and Pierre-Luc Bacon},
journal= {arXiv preprint arXiv:2512.04341},
year = {2026}
}
备注
ICML 2026. 50 pages, 15 figures. Code is available at https://github.com/twni2016/neubay