中文

基于选择性过渡纠正的跨域离线策略适应

机器学习 2026-02-06 v1

摘要

在强化学习(RL)中,跨域离线策略适应仍是一个关键挑战。本文研究跨域离线 RL,即可以访问来自另一个类似源域的离线数据集以增强针对目标域数据集的策略学习。直接合并两个数据集可能导致次优性能 due to 潜在的动力学不匹配。现有方法通常通过源域过渡过滤或奖励修改来缓解此问题,但可能导致对宝贵源域数据的充分利用不足。相反,我们提出修改源域数据以匹配目标域数据。为此,我们利用逆策略模型和奖励模型纠正源过渡的动作和奖励,显式实现与目标动力学的对齐。由于有限数据可能导致模型训练不准确,我们进一步采用前向动力学模型保留纠正后的样本,这些样本比原始过渡更符合目标动力学。 Consequently,我们提出了选择性过渡纠正(STC)算法,使源域数据可靠地用于策略适应。各种具有动力学偏移的环境上的实验表明,STC 在现有基线之上实现了卓越的性能。

关键词

引用

@article{arxiv.2602.05776,
  title  = {Cross-Domain Offline Policy Adaptation via Selective Transition Correction},
  author = {Mengbei Yan and Jiafei Lyu and Shengjie Sun and Zhongjian Qiao and Jingwen Yang and Zichuan Lin and Deheng Ye and Xiu Li},
  journal= {arXiv preprint arXiv:2602.05776},
  year   = {2026}
}