中文

MOBODY:基于模型的离动态离线强化学习

机器学习 2026-03-19 v3 人工智能 机器人学

摘要

我们研究离动态离线强化学习,其中目标是从离线源数据和有限目标数据中学习策略,二者的动力学不匹配。现有方法要么对奖励进行惩罚,要么丢弃动力学偏移较大的源数据集中的转换。结果是,这些方法仅使用来自低偏移区域的数据来优化策略,限制了对目标域中高奖励状态的探索(这些状态不落在这些区域内)。因此,这些方法在动力学偏移显著或最优轨迹位于低偏移区域之外时常常失败。为克服这一限制,我们提出了 MOBODY,一种基于模型的离动态离线强化学习算法,通过学习的目标动力学转换来探索目标域进行策略优化,而不是仅使用低动力学偏移的转换进行训练。对于动力学学习,基于实现相同下一个状态需要在不同域中采取不同动作这一观察,MOBODY 为每个域采用独立的动作编码器,将不同动作编码到共享的潜在空间,同时共享统一的状态表示和通用的转换函数。我们进一步引入基于目标 Q 加权的行为克隆损失,以避免离散动作分布外的动作,将策略推向具有高目标域 Q 值的动作,而非高源域 Q 值的动作或均匀模仿离线数据集中所有动作。我们在广泛的 MuJoCo 和 Adroit 基准上评估了 MOBODY,证明它在各种场景下均优于基于不同动力学学习基线的领先的离动态 RL 方法,尤其在现有方法难以应对的挑战性场景中表现尤为突出。

关键词

引用

@article{arxiv.2506.08460,
  title  = {MOBODY: Model Based Off-Dynamics Offline Reinforcement Learning},
  author = {Yihong Guo and Yu Yang and Pan Xu and Anqi Liu},
  journal= {arXiv preprint arXiv:2506.08460},
  year   = {2026}
}

备注

Published at ICLR 2026