OmniGCD:面向模态无关的广义类别发现抽象
计算机视觉与模式识别
2026-04-17 v1
摘要
广义类别发现 (GCD) 要求方法利用部分标注数据识别已知类别和新类别,这反映了人类的类别学习过程。以往的 GCD 方法在单一模态内运行并需要针对特定数据集进行微调,与此不同,我们受人类大脑抽象类别形成的启发,提出了一种模态无关的 GCD 方法。我们的 利用模态特定编码器(例如视觉、音频、文本、遥感)处理输入,随后进行降维以构建 ,并在测试时使用一种新颖的基于 Transformer 的合成数据训练模型将其转换为更适合聚类的表示。为了评估 OmniGCD,我们引入了 ,其中不允许针对特定数据集进行微调,从而实现模态无关的类别发现。 后,OmniGCD 跨越四种模态的 16 个数据集执行零样本 GCD,与基线相比提高了已知和新类别的分类准确率(视觉、文本、音频和遥感的平均百分点提升分别为 、、 和 )。这凸显了强编码器的重要性,同时将表示学习与类别发现解耦。改进模态无关方法将跨模态泛化,使编码器的开发独立于 GCD。我们的工作作为未来模态无关 GCD 工作的基准,为可扩展的、受人类启发的类别发现铺平了道路。所有代码可在 获取
引用
@article{arxiv.2604.14762,
title = {OmniGCD: Abstracting Generalized Category Discovery for Modality Agnosticism},
author = {Jordan Shipard and Arnold Wiliem and Kien Nguyen Thanh and Wei Xiang and Clinton Fookes},
journal= {arXiv preprint arXiv:2604.14762},
year = {2026}
}
备注
Accepted to CVPR 2026 Findings