中文

DmC:基于最近邻引导的离线跨域强化学习扩散模型

机器学习 2025-10-28 v2 人工智能

摘要

跨域离线强化学习 (RL) 旨在通过利用额外的离线源数据来提高离线 RL 的样本效率。关键挑战在于识别和利用与目标域最相关的源样本。现有方法通过域分类器衡量域间差异、建模目标状态转移动力学或使用对比损失估计互信息来解决此挑战。然而,这些方法通常需要大量目标数据,而在许多实际场景中这并不切实可行。在本工作中,我们在目标数据有限的条件下进行跨域离线 RL,识别出两个主要挑战:(1) 数据不平衡,由大量源数据和有限目标数据导致,引发神经网络基于域间差异估计器的过拟合,产生无信息的测量结果;(2) 部分域重叠,仅有子集源数据与目标域紧密对齐。为克服此问题,我们提出了 DmC,一个针对目标样本有限的跨域离线 RL 框架。具体而言,DmC 利用基于 k-最近邻 (k-NN) 的估计方法衡量域间相似性,而无需神经网络训练,从而有效缓解了过拟合问题。随后,凭借该域相似性度量,我们引入了最近邻引导的扩散模型,以生成更贴合目标域的额外源样本,从而利用更有效的源样本增强策略学习。在多样化的 MuJoCo 环境中进行理论分析和大量实验表明,DmC 在跨域离线 RL 中显著优于最先进的方法,实现了显著的性能提升。

关键词

引用

@article{arxiv.2507.20499,
  title  = {DmC: Nearest Neighbor Guidance Diffusion Model for Offline Cross-domain Reinforcement Learning},
  author = {Linh Le Pham Van and Minh Hoang Nguyen and Duc Kieu and Hung Le and Hung The Tran and Sunil Gupta},
  journal= {arXiv preprint arXiv:2507.20499},
  year   = {2025}
}

备注

accepted at ECAI 2025; offline cross-domain reinforcement learning with a guided diffusion model;