中文

基于隐式可微自适应加权的鲁棒价值感知模型学习:面向模型基离线强化学习

机器学习 2026-03-10 v1

摘要

模型基离线强化学习(RL)旨在通过动态模型促进策略探索。然而,由于不可避免的模型误差,存在 model exploitation 风险,导致算法性能下降。对抗模型学习提供了理论框架以解决 model exploitation,通过求解 maximin 公式。于是,RAMBO~\citep{rigter2022rambo} 作为代表性且最流行的方法,提供了一种实用实现,基于模型梯度。然而,我们经验性地发现,RAMBO 在仅略微调整超参数的情况下会发生严重的 Q 值低估和梯度爆炸,表明其倾向于过于保守且存在不稳定的模型更新。为缓解这些问题,我们提出鲁棒价值感知模型学习与隐式可微自适应加权(ROMI)。ROMI 引入一种新型鲁棒价值感知模型学习方法。该方法要求动态模型预测未来状态,其价值接近可调状态不确定性集内 minimum Q 值的比例,从而实现可控的保守性和稳定的模型更新。为进一步提高多步 rollout 中的 out-of-distribution(OOD)泛化能力,我们提出隐式可微自适应加权,一种 bi-level 优化方案,实现动态和价值感知模型学习的自适应。在 D4RL 和 NeoRL 数据集上的实验结果表明,ROMI 在模型性能上显著优于 RAMBO,并在 RAMBO 通常表现不佳的数据集上实现与其他 state-of-the-art 方法的竞争或优异性能。代码已发布于 https://github.com/zq2r/ROMI.git。

关键词

引用

@article{arxiv.2603.08118,
  title  = {Model-based Offline RL via Robust Value-Aware Model Learning with Implicitly Differentiable Adaptive Weighting},
  author = {Zhongjian Qiao and Jiafei Lyu and Boxiang Lyu and Yao Shu and Siyang Gao and Shuang Qiu},
  journal= {arXiv preprint arXiv:2603.08118},
  year   = {2026}
}

备注

Accepted at ICLR 2026