基于贝叶斯自适应蒙特卡洛树搜索树的离线模型基强化学习
机器学习
2026-01-28 v4 人工智能
摘要
离线强化学习(RL)是数据驱动决策和控制的强大方法。与模型无关方法相比,离线模型基强化学习(MBRL)显式地从静态数据集中学习世界模型,并将其作为代理模拟器使用,提高了数据效率,并使所学策略有望在数据集支持范围之外进行泛化。然而,可能存在各种在离线数据集上行为相同且处理关于真实MDP模型不确定性具有挑战性。在本文中,我们将离线MBRL建模为贝叶斯自适应马尔可夫决策过程(BAMDP),这是一个原则性的框架,用于处理模型不确定性。我们进一步提出一种新型的贝叶斯自适应蒙特卡洛树搜索树算法,能够在连续状态和动作空间中解决BAMDPs。该规划过程基于蒙特卡洛树搜索,可集成到离线MBRL中作为策略迭代中的策略改进算子。我们的"RL + Search"框架遵循AlphaZero等超人类AI的先例,通过纳入更多计算资源来提高当前离线MBRL方法的性能。该算法在十二个D4RL MuJoCo任务和三个具有挑战性且具有随机性的托卡马克控制任务上显著优于最先进的离线RL方法。代码地址: https://github.com/LucasCJYSDL/Offline-RL-Kit。
引用
@article{arxiv.2410.11234,
title = {Bayes Adaptive Monte Carlo Tree Search for Offline Model-based Reinforcement Learning},
author = {Jiayu Chen and Le Xu and Wentse Chen and Jeff Schneider},
journal= {arXiv preprint arXiv:2410.11234},
year = {2026}
}
备注
This paper is accepted in ICLR 2026