中文

反思-规划:通过双贝叶斯视角的离线模型基规划

人工智能 2025-06-09 v1 机器学习

摘要

离线强化学习(RL)在在线探索成本高昂或不安全时至关重要,但往往因有限数据导致高 epistemic 不确定性。现有方法依赖固定保守策略,限制了适应性和泛化能力。为此,我们提出 Reflect-then-Plan(RefPlan),一种基于双贝叶斯视角的离线模型基(MB)规划新方法。RefPlan 通过将规划重新诠释为贝叶斯后验估计来统一不确定性建模与 MB 规划。在部署时,它使用实时观察更新环境动力学的信念,并通过边缘化将不确定性纳入 MB 规划。实验结果表明,RefPlan 在标准基准测试上显著提升了保守离线 RL 策略的性能。特别是,RefPlan 在高 epistemic 不确定性和数据有限的情况下保持稳健性能,同时展现出对变化环境动力学的鲁棒性,提高了离线学习策略的灵活性、泛化性和鲁棒性。

关键词

引用

@article{arxiv.2506.06261,
  title  = {Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens},
  author = {Jihwan Jeong and Xiaoyu Wang and Jingmin Wang and Scott Sanner and Pascal Poupart},
  journal= {arXiv preprint arXiv:2506.06261},
  year   = {2025}
}