中文

MGDA:面向离线目标条件加权监督学习的基于模型的目标数据增强

机器学习 2024-12-23 v2

摘要

最近,一类被称为目标条件加权监督学习(GCWSL)方法的最先进算法被提出,以应对离线目标条件强化学习(RL)中的挑战。GCWSL优化了目标条件RL目标的下界,并在各种目标达成任务中展现出卓越性能,提供了一种简单、有效且稳定的解决方案。然而,先前的研究发现了GCWSL的一个关键局限性:缺乏轨迹拼接能力。为了解决这个问题,人们提出了目标数据增强策略来增强这些方法。然而,现有技术往往难以有效地为GCWSL采样合适的增强目标。在本文中,我们建立了目标数据增强的统一原则,重点关注目标多样性、动作最优性和目标可达性。基于这些原则,我们提出了一种基于模型的目标数据增强(MGDA)方法,该方法利用学习到的动力学模型来采样更合适的增强目标。MGDA独特地在学习到的模型中引入了局部Lipschitz连续性假设,以减轻复合误差的影响。实验结果表明,MGDA显著提升了GCWSL方法在基于状态和基于视觉的迷宫数据集上的性能,在改善拼接能力方面超越了以往的目标数据增强技术。

关键词

引用

@article{arxiv.2412.11410,
  title  = {MGDA: Model-based Goal Data Augmentation for Offline Goal-conditioned Weighted Supervised Learning},
  author = {Xing Lei and Xuetao Zhang and Donglin Wang},
  journal= {arXiv preprint arXiv:2412.11410},
  year   = {2024}
}