中文

显著性引导表示与一致性策略学习用于视觉无监督强化学习

计算机视觉与模式识别 2026-04-08 v1 人工智能

摘要

零样本无监督强化学习(URL)为构建能够泛化到未见任务的通用智能体提供了有前景的方向。在现有方法中,后继表示(SR)因其结构化低维环境中的有效性而成为突出的范式。然而,SR方法难以扩展到高维视觉环境。通过实证分析,我们识别出SR在视觉URL中的两个关键局限:(1)SR目标往往导致次优表示,这些表示关注动力学无关区域,导致后继度量不准确和任务泛化能力下降;(2)这些有缺陷的表示阻碍了SR策略对多模态技能条件动作分布的建模,并确保技能可控性。为解决这些局限,我们提出了显著性引导表示与一致性策略学习(SRCP),一种改进视觉URL中SR方法零样本泛化的新框架。SRCP通过引入显著性引导动力学任务来捕捉动力学相关表示,从而解耦表示学习与后继训练,进而改善后继度量和任务泛化。此外,它集成了快速采样一致性策略,并结合URL特定的无分类器引导和定制训练目标,以改善技能条件策略建模和可控性。在ExORL基准上的16个任务、4个数据集上的广泛实验表明,SRCP在视觉URL中实现了最先进的零样本泛化,并且兼容多种SR方法。

关键词

引用

@article{arxiv.2604.05931,
  title  = {Saliency-Guided Representation with Consistency Policy Learning for Visual Unsupervised Reinforcement Learning},
  author = {Jingbo Sun and Qichao Zhang and Songjun Tu and Xing Fang and Yupeng Zheng and Haoran Li and Ke Chen and Dongbin Zhao},
  journal= {arXiv preprint arXiv:2604.05931},
  year   = {2026}
}