中文

MOOSS:基于掩码增强的时序对比学习用于视觉强化学习中的平滑状态演化

计算机视觉与模式识别 2024-09-05 v1 机器学习

摘要

在视觉强化学习(RL)中,基于像素的观测进行学习在样本效率方面面临重大挑战,主要由于从高维数据中提取有信息的状态表征的复杂性。以往的方法,如对比学习方法,虽在提升样本效率方面取得了进展,但在建模状态演化的细微变化方面仍不足。为此,我们引入MOOSS框架,利用图基时空掩码辅助的时序对比目标,显式建模视觉RL中的状态演化。具体而言,我们提出一种自监督双组分策略,集成(1)基于像素的观测构建图结构进行时空掩码,以及(2)多层次对比学习机制,通过强调状态的时间连续性与变化,丰富状态表征。MOOSS通过扰乱和学习时空关联来促进策略学习,从而增进对状态动力学的理解。我们的全面评估表明,在多个连续和离散控制基准测试中,MOOSS在样本效率方面优于先前的最先进视觉RL方法,证明了该方法的有效性。我们的代码已发布于https://github.com/jsun57/MOOSS。

关键词

引用

@article{arxiv.2409.02714,
  title  = {MOOSS: Mask-Enhanced Temporal Contrastive Learning for Smooth State Evolution in Visual Reinforcement Learning},
  author = {Jiarui Sun and M. Ugur Akcal and Wei Zhang and Girish Chowdhary},
  journal= {arXiv preprint arXiv:2409.02714},
  year   = {2024}
}

备注

WACV 2025