中文

基于贝叶斯优化的离线模型基RL主动模型选择方法

机器学习 2025-02-18 v1 机器学习

摘要

离线模型基强化学习(MBRL)是一个仅能从预收集的数据中借助学习到的动态模型就能获得优异策略的竞争框架。为了充分发挥离线MBRL的潜力,模型选择在决定下游策略学习所使用的动态模型方面起着关键作用。然而,传统的离线MBRL依赖验证或离线评估,这些方法由于离线RL中固有的分布迁移问题往往不够准确。为此,我们提出BOMS(Bayesian Optimization for Model Selection),通过贝叶斯优化(BO)的视角,通过仅利用小量在线交互预算来增强离线MBRL中的模型选择。具体而言,我们将模型选择重新建模为BO问题,通过提出一种新颖的模型诱导核函数实现概率推断,该方法在理论上得到 grounding且计算效率高。通过大量实验,我们展示BOMS在各种RL任务上相较于基线方法具有显著优势,所需的在线交互量仅相当于离线训练数据的1%至2.5%。

引用

@article{arxiv.2502.11480,
  title  = {Enhancing Offline Model-Based RL via Active Model Selection: A Bayesian Optimization Perspective},
  author = {Yu-Wei Yang and Yun-Ming Chan and Wei Hung and Xi Liu and Ping-Chun Hsieh},
  journal= {arXiv preprint arXiv:2502.11480},
  year   = {2025}
}

备注

18 pages, 6 figures