中文

通过扩散薛定谔桥接实现跨域强化学习中的动力学差距

机器学习 2026-03-02 v1 人工智能

摘要

跨域强化学习(RL)旨在信赖源域和目标域之间动力学变化的可转移策略。关键挑战在于缺乏目标域环境交互和奖励监督,阻止直接策略学习。为此,我们提出了跨域强化学习中的动力学差距桥接(BDGRL),一个新型框架,利用扩散薛定谔桥(DSB)将源域转换与编码于离线演示中的目标域动力学对齐。此外,我们引入奖励调制机制,基于状态转换估计奖励,应用于DSB对齐样本,以确保奖励与目标域动力学一致。BDGRL在源域内完成目标导向的策略学习,无需访问目标环境或其奖励。在MuJoCo跨域基准测试上进行实验,表明BDGRL在状态最佳基线上 outperform了,并在转换动力学变化下展现出强大的适应性。

关键词

引用

@article{arxiv.2602.23737,
  title  = {Bridging Dynamics Gaps via Diffusion Schr\"odinger Bridge for Cross-Domain Reinforcement Learning},
  author = {Hanping Zhang and Yuhong Guo},
  journal= {arXiv preprint arXiv:2602.23737},
  year   = {2026}
}