中文

基于动力学与价值对齐数据过滤的高效跨域离线强化学习

机器学习 2026-03-23 v4

摘要

跨域离线强化学习(RL)旨在利用目标域数据以及(可能具有足够数据覆盖的)源域数据,在目标环境中训练出表现良好的智能体。由于源域与目标域之间存在底层动力学不一致,盲目合并两个数据集可能导致性能下降。近期研究通过选择动力学与目标域对齐良好的源域样本来缓解此问题。然而,我们的工作表明仅凭动力学对齐是不够的,通过检视现有框架的局限性,推导出针对在源域上学习的策略在目标域的次优性界限。更重要的是,我们的理论强调还需进行“价值对齐”,即从源域中选择高质量、高价值的样本,这是现有研究所忽略的关键维度。基于此理论洞见,我们提出了动力学与价值对齐数据过滤(DVDF)方法,是一个新的统一式跨域 RL 框架,仅选择在动力学与价值两个维度上都表现出强对齐的源域样本。我们研究了各种动力学偏移场景,包括运动学偏移和形态学偏移,在各种任务和数据集上评估了 DVDF,甚至在目标域数据极其有限的困难情况下也表现出色。大量实验表明,DVDF 在所有基线上均显著优于,提升显著。

关键词

引用

@article{arxiv.2512.02435,
  title  = {Efficient Cross-Domain Offline Reinforcement Learning with Dynamics- and Value-Aligned Data Filtering},
  author = {Zhongjian Qiao and Rui Yang and Jiafei Lyu and Chenjia Bai and Xiu Li and Siyang Gao and Shuang Qiu},
  journal= {arXiv preprint arXiv:2512.02435},
  year   = {2026}
}