中文

基于 Bellman 一致性与混合 critic 的跨域策略优化

机器学习 2026-03-13 v1

摘要

跨域强化学习(CDRL)旨在通过利用从源域收集的数据样本来促进目标域相似领域学习的效率。尽管具有潜力,但跨域 RL 已知面临两个根本且交织的挑战:(i) 源域和目标域可能具有不同的状态空间或动作空间,这使得直接迁移不可行,需更复杂的域间映射;(ii) 源域模型的可迁移性难以事先识别,因而 CDRL 在迁移过程中容易产生负面影响。本文提出通过 cross-domain Bellman consistency 与 hybrid critic 的视角联合应对这两个挑战。具体而言,我们首次引入 cross-domain Bellman consistency 以衡量源域模型的可迁移性。随后,我们提出 QAvatar,将源域和目标域的 Q 函数与自适应无超参数权重函数相结合。通过该设计,我们刻画了 QAvatar 的收敛行为,证明 QAvatar 以有效利用源域 Q 函数实现可靠迁移。通过实验,我们展示 QAvatar 在包括 locomotion 与机器人臂操控等各种 RL 基准任务上实现了 favorable transferability。 Our code is available at https://rl-bandits-lab.github.io/Cross-Domain-RL/.

关键词

引用

@article{arxiv.2603.12087,
  title  = {Cross-Domain Policy Optimization via Bellman Consistency and Hybrid Critics},
  author = {Ming-Hong Chen and Kuan-Chen Pan and You-De Huang and Xi Liu and Ping-Chun Hsieh},
  journal= {arXiv preprint arXiv:2603.12087},
  year   = {2026}
}

备注

Accepted at ICLR 2026