中文

面向动态变化的双鲁棒跨域离线强化学习

机器学习 2026-03-10 v2

摘要

单域离线强化学习(RL)常因数据覆盖范围有限而受限,而跨域离线RL通过利用来自其他域的额外数据来处理动态变化的问题。然而,现有研究主要关注训练时的鲁棒性(处理来自训练数据的动态变化),忽略了在实际场景中部署时对动态扰动的测试时鲁棒性。在本文中,我们探索了跨域离线RL中针对动态变化的双鲁棒性(训练时和测试时的鲁棒性)。首先,我们实证表明,针对动态变化的跨域离线RL训练的策略在评估期间对动态扰动极其脆弱,尤其是在目标域数据有限的情况下。为此,我们引入了一种新颖的鲁棒跨域Bellman(RCB)算子,增强了对动态扰动的测试时鲁棒性,同时保持对超出分布动态转换的保守性,从而保证训练时的鲁棒性。为进一步抵消RCB算子可能导致的价值过估计或不足估计,我们引入两种技术,即动态价值惩罚和Huber损失,形成实用的双鲁棒跨域离线RL(DROCO)算法。广泛的实证结果显示,DROCO在各种动态变化场景下均优于强基准方法,并在动态扰动上表现出增强的鲁棒性。

关键词

引用

@article{arxiv.2512.02486,
  title  = {Dual-Robust Cross-Domain Offline Reinforcement Learning Against Dynamics Shifts},
  author = {Zhongjian Qiao and Rui Yang and Jiafei Lyu and Xiu Li and Zhongxiang Dai and Zhuoran Yang and Siyang Gao and Shuang Qiu},
  journal= {arXiv preprint arXiv:2512.02486},
  year   = {2026}
}

备注

Accepted at ICLR 2026