中文

SpectralGCD:谱方法用于通用类别发现的概念选择与跨模态表征学习

计算机视觉与模式识别 2026-02-20 v1 人工智能 机器学习

摘要

通用类别发现(GCD)旨在在无标签数据中识别新类别,同时利用小量已知类别的标签子集。仅基于图像特征训练的参数化分类器常导致对旧类别过拟合,近期的多模态方法通过纳入文本信息来提高性能。然而,这些方法通常独立处理各模态,计算成本高。我们提出SpectralGCD,一种高效且有效的多模态GCD方法,利用CLIP跨模态图像-概念相似度作为统一的跨模态表征。每个图像表示为来自大型任务无关词典中语义概念的混合物,这些概念锚定学习,减少对虚假视觉线索的依赖。为保持由高效学生模型学习的表征的语义质量,我们引入Spectral Filtering,利用来自强大教师模型测量的softmax化相似度的交叉模态协方差矩阵,自动保留词典中与任务相关的概念。来自同一教师的前向和逆向知识蒸馏确保学生的跨模态表征既语义充分,又良好对齐。在六个基准数据集上,SpectralGCD在计算成本的六分之一左右,就能实现与最先进方法相当或更好的准确率。代码已公开:https://github.com/miccunifi/SpectralGCD。

关键词

引用

@article{arxiv.2602.17395,
  title  = {SpectralGCD: Spectral Concept Selection and Cross-modal Representation Learning for Generalized Category Discovery},
  author = {Lorenzo Caselli and Marco Mistretta and Simone Magistri and Andrew D. Bagdanov},
  journal= {arXiv preprint arXiv:2602.17395},
  year   = {2026}
}

备注

Accepted at ICLR 2026. Code available at https://github.com/miccunifi/SpectralGCD