基于半监督率缩减的通用类别发现的多模态表示学习
计算机视觉与模式识别
2026-04-01 v2
摘要
通用类别发现(GCD)旨在识别已知和未知类别,仅给定部分已知类别的标签,构成一个具有挑战性的开放集识别问题。当前 GCD 方法通常基于多模态表示学习,严重依赖于模间对齐。然而,很少有方法对内模对齐进行恰当的建模,以生成期望的表示分布结构。在本文中,我们提出一种新型且有效的多模态表示学习框架,用于 GCD,通过半监督率缩减实现,称为 SSR-GCD,以强调正确对齐内模关系,学习具有期望结构属性的跨模态表示。此外,为提升知识迁移,我们整合了通过视觉语言模型提供的模间对齐所获得的提示候选。我们在通用和细粒度基准数据集上进行大量实验,证明了我们方法的优越性能。
引用
@article{arxiv.2602.19910,
title = {Multi-Modal Representation Learning via Semi-Supervised Rate Reduction for Generalized Category Discovery},
author = {Wei He and Xianghan Meng and Zhiyuan Huang and Xianbiao Qi and Rong Xiao and Chun-Guang Li},
journal= {arXiv preprint arXiv:2602.19910},
year = {2026}
}
备注
15 pages, accepted by CVPR 2026