基于世界模型的无关策略自举
机器学习
2026-01-16 v3 人工智能
机器人学
摘要
在强化学习中,线上规划已证明有效,能提高样本效率和最终性能。然而,利用规划进行环境交互不可避免地引入收集数据与策略实际行为之间的偏差,损害模型学习和策略改进。为此,我们提出BOOM(Bootstrap Off-policy with WOrld Model),一个通过自举循环紧密集成规划与无关策略学习的框架:策略初始化规划器,规划器通过行为对齐对动作进行精炼,以实现对策略的自举。该循环由 jointly 学习的世界模型支持,使规划器能够模拟未来轨迹,并为策略改进提供价值目标。BOOM的核心是一种几乎不依赖似然值的对齐损失,利用规划器的非参数动作分布对策略进行自举,并结合软价值加权机制,以优先考虑高回报行为,减轻回放缓冲区内规划器动作质量的变异性。在DeepMind Control Suite和Humanoid-Bench上的实验表明,BOOM在训练稳定性和最终性能方面均实现了最先进的结果。代码可在 https://github.com/molumitu/BOOM_MBRL 访问。
引用
@article{arxiv.2511.00423,
title = {Bootstrap Off-policy with World Model},
author = {Guojian Zhan and Likun Wang and Xiangteng Zhang and Jiaxin Gao and Masayoshi Tomizuka and Shengbo Eben Li},
journal= {arXiv preprint arXiv:2511.00423},
year = {2026}
}
备注
NeurIPS 2025