通过扩散薛定谔桥接实现跨域强化学习中的动力学差距
机器学习
2026-03-02 v1 人工智能
摘要
跨域强化学习(RL)旨在信赖源域和目标域之间动力学变化的可转移策略。关键挑战在于缺乏目标域环境交互和奖励监督,阻止直接策略学习。为此,我们提出了跨域强化学习中的动力学差距桥接(BDGRL),一个新型框架,利用扩散薛定谔桥(DSB)将源域转换与编码于离线演示中的目标域动力学对齐。此外,我们引入奖励调制机制,基于状态转换估计奖励,应用于DSB对齐样本,以确保奖励与目标域动力学一致。BDGRL在源域内完成目标导向的策略学习,无需访问目标环境或其奖励。在MuJoCo跨域基准测试上进行实验,表明BDGRL在状态最佳基线上 outperform了,并在转换动力学变化下展现出强大的适应性。
引用
@article{arxiv.2602.23737,
title = {Bridging Dynamics Gaps via Diffusion Schr\"odinger Bridge for Cross-Domain Reinforcement Learning},
author = {Hanping Zhang and Yuhong Guo},
journal= {arXiv preprint arXiv:2602.23737},
year = {2026}
}