中文

面向离线强化学习的局部动力学感知域适应

机器学习 2026-02-25 v1 人工智能 机器人学

摘要

离线强化学习(RL)旨在使用有限目标数据和丰富来源数据,学习适用于不同转移动力学的目标域策略。现有方法通常以全局方式处理状态空间或通过点数据过滤来解决动力学不匹配;这些方法可能忽略局部跨域相似性,或产生高计算成本。我们提出一种局部动力学感知域适应方法(LoDADA),利用局部动力学不匹配以更好地复用来源数据。LoDADA 对来源数据和目标数据中的转移进行聚类,并通过域判别估计聚类级别的动力学差异。保留来自差异较小的聚类的来源转移,过滤来自差异较大的聚类的来源转移。这导致一种细粒度且可扩展的数据选择策略,避免过于粗糙的全局假设和高昂的逐样本过滤成本。我们提供了理论见解并在具有多样化全局和局部动力学偏移的环境中进行大量实验。结果表明,LoDADA 在更有效地利用局部分布不匹配方面 consistently 超过最先进的离线强化学习方法。

关键词

引用

@article{arxiv.2602.21072,
  title  = {Localized Dynamics-Aware Domain Adaption for Off-Dynamics Offline Reinforcement Learning},
  author = {Zhangjie Xia and Yu Yang and Pan Xu},
  journal= {arXiv preprint arXiv:2602.21072},
  year   = {2026}
}

备注

33 pages, 9 figures, 11 tables