中文

面向跨域离线强化学习的目标对齐生成

机器学习 2026-05-14 v1 人工智能

摘要

跨域离线强化学习旨在仅通过预收集的数据,从源域适配策略至目标域,其中环境动力学可能不同。关键挑战在于如何利用源数据以降低分布性不匹配,尤其当目标数据极其有限时。为此,我们提出 Target-aligned Coverage Expansion(TCE)框架,决定源数据应如何被使用:要么直接纳入接近目标的转移,要么通过目标对齐生成扩展状态覆盖,依据理论分析为导向。TCE 基于双 score-based 生成模型,对扩展后的状态区域合成目标一致的转移。广泛实验表明,TCE 在多样化跨域环境中持续超越最新跨域离线 RL 基线。

关键词

引用

@article{arxiv.2605.13054,
  title  = {Bridging Domain Gaps with Target-Aligned Generation for Offline Reinforcement Learning},
  author = {Minung Kim and Jeongmo Kim and Gwanwoo Choi and Seungyul Han},
  journal= {arXiv preprint arXiv:2605.13054},
  year   = {2026}
}