中文

CLIP-GCD:基于简单语言引导的广义类别发现

计算机视觉与模式识别 2023-05-18 v1

摘要

广义类别发现(GCD)要求模型既对已知类别进行分类,又对未标记数据中的未知类别进行聚类。先前的方法利用自监督预训练结合在标记数据上的监督微调,随后使用简单的聚类方法。在本文中,我们认为此类方法在分布外类别上仍然容易出现较差性能,并且没有利用一个关键要素:对象类别之间的语义关系。因此我们提出以两种互补的方式利用多模态(视觉和语言)模型。首先,受 CLIP 零样本性能的启发,我们通过用 CLIP 替换单模态特征建立了一个强基线。其次,我们提出了一种新颖的基于检索的机制,通过从文本语料库中为标记集和未标记集挖掘文本描述,利用 CLIP 对齐的视觉-语言表示。我们具体使用 CLIP 对图像的可视编码与语料库文本编码之间的对齐来检索前 k 个相关文本片段,并融合其嵌入以执行联合图像+文本半监督聚类。我们进行了严格的实验和消融研究(包括从何处检索、检索多少以及如何组合信息),并在包括分布外域的多个数据集上验证了我们的结果,展示了最先进的成果。

关键词

引用

@article{arxiv.2305.10420,
  title  = {CLIP-GCD: Simple Language Guided Generalized Category Discovery},
  author = {Rabah Ouldnoughi and Chia-Wen Kuo and Zsolt Kira},
  journal= {arXiv preprint arXiv:2305.10420},
  year   = {2023}
}