中文

GET: 解锁 CLIP 多模态潜能的通用类别发现

计算机视觉与模式识别 2025-03-24 v3 人工智能 计算与语言 机器学习

摘要

给定包含旧类和新类的无标签数据集,通用类别发现(GCD)旨在准确发现新类别的同时正确分类旧类别。当前 GCD 方法仅使用单一视觉模态信息,导致相似视觉类别的分类不佳。作为不同模态,文本信息可提供互补的判别信息,这促使我们将其引入 GCD 任务。然而,缺乏对无标签数据类别名称的标注,使得实际运用文本信息变得不可行。为克服这一挑战,本文提出了文本嵌入合成器(TES),用于为无标签样本生成伪文本嵌入。具体而言,TES 利用 CLIP 能够生成对齐视觉-语言特征的特性,将视觉嵌入转换为 CLIP 文本编码器的标记,以生成伪文本嵌入。此外,我们采用双分支框架,通过不同模态分支的联合学习和实例一致性,视觉和语义信息相互增强,促进视觉和文本知识的交互与融合。我们的方法解锁了 CLIP 的多模态潜能,在所有 GCD 基准测试中均以显著的优势超越基线方法,取得新的最先进成绩。我们的代码可在:https://github.com/enguangW/GET 获取。

关键词

引用

@article{arxiv.2403.09974,
  title  = {GET: Unlocking the Multi-modal Potential of CLIP for Generalized Category Discovery},
  author = {Enguang Wang and Zhimao Peng and Zhengyuan Xie and Fei Yang and Xialei Liu and Ming-Ming Cheng},
  journal= {arXiv preprint arXiv:2403.09974},
  year   = {2025}
}

备注

CVPR 2025