中文

异构数据集下的跨域离线强化学习中的价值对齐与赋值统一框架

机器学习 2026-05-26 v1

摘要

跨域离线强化学习 (RL) 旨在利用目标域中有限的数据以及源域数据(存在动态偏移)来学习策略。直接在原始源数据上训练通常会导致性能崩溃。最近的研究从动态对齐或价值对齐角度进行数据过滤,以实现高效策略迁移。然而,这些研究通常在单域或单行为策略源数据上进行验证。在本工作中,我们探讨了更为一般的异构跨域离线 RL 设置,即源数据可能由多个源域通过不同行为策略收集。我们首先揭示了该设置中一个关键且被忽视的问题:价值误赋值。经验和理论地,我们表明,价值误赋值会削弱价值对齐,误导数据过滤选择次优样本,导致次优间隙放宽,从而降低智能体的性能。为此,我们提出了 V2A,集成了动态对齐、价值对齐和价值赋值。V2A首先采用时序一致的模态表示学习从源数据中提取动态模态,随后采用模态感知的优势学习来纠正价值对齐。最后,它采用数据过滤范式选择性地共享源数据以用于策略学习。实验结果表明,在一般的异构跨域离线 RL 设置下,V2A显著优于强大的基线方法。

关键词

引用

@article{arxiv.2605.24862,
  title  = {Unifying Value Alignment and Assignment in Cross-Domain Offline Reinforcement Learning with Heterogeneous Datasets},
  author = {Zhongjian Qiao and Jiafei Lyu and Chenjia Bai and Peisong Wang and Siyang Gao and Shuang Qiu},
  journal= {arXiv preprint arXiv:2605.24862},
  year   = {2026}
}

备注

Accepted at ICML 2026