中文

SOMBRL:可扩展且乐观的模型基强化学习

机器学习 2025-11-26 v1

摘要

我们解决模型基强化学习(MBRL)中高效探索的挑战,其中系统动力学未知,强化学习智能体必须直接从在线交互中学习。我们提出可扩展且乐观的MBRL(SOMBRL),一种基于乐观置信原则的methods。SOMBRL学习一个具有不确定性感知的动力学模型,并贪心地最大化外在奖励与智能体认知不确定性的加权和。SOMBRLCompatible于任何策略优化器或规划器,在常见的系统正则性假设下,我们证明SOMBRL在(i)有限时长、(ii)折扣无限时长和(iii)非序列设置下具有亚线性报酬。此外,SOMBRL提供了一个灵活且可扩展的原则性探索解决方案。我们在基于状态和视觉控制环境中评估SOMBRL,其中在所有任务和基准之间显示出良好性能。我们还在动态RC汽车硬件上评估SOMBRL,表明SOMBRL超过了最前沿的水平,说明了原则性探索对MBRL的益处。

关键词

引用

@article{arxiv.2511.20066,
  title  = {SOMBRL: Scalable and Optimistic Model-Based RL},
  author = {Bhavya Sukhija and Lenart Treven and Carmelo Sferrazza and Florian Dörfler and Pieter Abbeel and Andreas Krause},
  journal= {arXiv preprint arXiv:2511.20066},
  year   = {2025}
}