中文

基于半监督率缩减的通用类别发现的多模态表示学习

计算机视觉与模式识别 2026-04-01 v2

摘要

通用类别发现(GCD)旨在识别已知和未知类别,仅给定部分已知类别的标签,构成一个具有挑战性的开放集识别问题。当前 GCD 方法通常基于多模态表示学习,严重依赖于模间对齐。然而,很少有方法对内模对齐进行恰当的建模,以生成期望的表示分布结构。在本文中,我们提出一种新型且有效的多模态表示学习框架,用于 GCD,通过半监督率缩减实现,称为 SSR2^2-GCD,以强调正确对齐内模关系,学习具有期望结构属性的跨模态表示。此外,为提升知识迁移,我们整合了通过视觉语言模型提供的模间对齐所获得的提示候选。我们在通用和细粒度基准数据集上进行大量实验,证明了我们方法的优越性能。

关键词

引用

@article{arxiv.2602.19910,
  title  = {Multi-Modal Representation Learning via Semi-Supervised Rate Reduction for Generalized Category Discovery},
  author = {Wei He and Xianghan Meng and Zhiyuan Huang and Xianbiao Qi and Rong Xiao and Chun-Guang Li},
  journal= {arXiv preprint arXiv:2602.19910},
  year   = {2026}
}

备注

15 pages, accepted by CVPR 2026