中文

借助返回引导的对比学习塑造视觉注意力

计算机视觉与模式识别 2025-12-15 v2 人工智能 机器人学

摘要

视觉强化学习 (RL) 智能体必须基于高维图像数据进行动作,而其中仅有一小部分像素与任务相关。这迫使智能体在无关特征上浪费探索和计算资源,导致样本效率低下且学习不稳定。为此,我们受人类视觉眼震的启发,提出Gaze on the Prize。该框架通过可学习的 foveal 注意力机制 (Gaze),辅以源自智能体追求更高回报(奖品)所获得的自监督信号,对视觉 RL 进行增强。我们的关键洞察是:回报差异揭示了最重要的特征——若两个相似的表示产生不同结果,其区分特征可能与任务相关,注意力应聚焦于这些特征。我们通过返回引导的对比学习来实现这一点,通过回报差异将相似的视觉表示分为正负样本,并构建对比三元组。这些三元组提供了训练信号,使注意力机制能够为与不同结果相关的状态产生可区分的表示。我们的方法在样本效率上实现了最高可达2.52倍的提升,并能解决ManiSkill3基准中的挑战性任务,而基线方法则无法学习,且无需修改底层算法或超参数。

关键词

引用

@article{arxiv.2510.08442,
  title  = {Gaze on the Prize: Shaping Visual Attention with Return-Guided Contrastive Learning},
  author = {Andrew Lee and Ian Chuang and Dechen Gao and Kai Fukazawa and Iman Soltani},
  journal= {arXiv preprint arXiv:2510.08442},
  year   = {2025}
}

备注

Project page: https://andrewcwlee.github.io/gaze-on-the-prize