中文

GraphVL: 基于视觉语言模型的图增强语义建模用于广义类别发现

计算机视觉与模式识别 2024-11-19 v2

摘要

广义类别发现旨在利用已知类别的带标签图像,将未标记图像聚类为已知类别和新颖类别。为了解决将特征从已知类别迁移到未知类别同时减轻模型偏差的挑战,我们引入了GraphVL,一种用于GCD中视觉语言建模的新方法,利用了CLIP。我们的方法将图卷积网络与CLIP的文本编码器集成,以保留类别邻域结构。我们还为图像数据采用了一个轻量级视觉投影器,通过基于边界的对比损失进行图像-文本映射,确保判别性特征。这种邻域保留准则有效地规范了语义空间,使其对已知类别不那么敏感。此外,我们从已知类别学习文本提示,并使用上下文相似性损失将它们对齐,为GCN层创建一个更具上下文意义的语义特征空间。最后,我们根据未标记样本与来自GCN的类别提示的语义距离来表示它们,从而实现用于类别发现的半监督聚类并最小化错误。我们在七个基准数据集上的实验一致地证明了GraphVL在与CLIP主干集成时的优越性。

关键词

引用

@article{arxiv.2411.02074,
  title  = {GraphVL: Graph-Enhanced Semantic Modeling via Vision-Language Models for Generalized Class Discovery},
  author = {Bhupendra Solanki and Ashwin Nair and Mainak Singha and Souradeep Mukhopadhyay and Ankit Jha and Biplab Banerjee},
  journal= {arXiv preprint arXiv:2411.02074},
  year   = {2024}
}

备注

Accepted in ACM ICVGIP 2024