中文

基于 CLIP 的网格拼图表示:图像聚类的新视角

计算机视觉与模式识别 2025-02-14 v2

摘要

面向图像聚类的无监督表示学习在计算机视觉中至关重要。尽管视觉模型的进步以高效的视觉表示改进了图像聚类,挑战依然存在。首先,现有特征常缺乏表示图像内部结构的能力,阻碍了对视觉相似图像的准确聚类。其次,更细粒度的语义标签常缺失,限制了对图像间细微差异与相似性的捕捉能力。本文中,我们提出图像聚类的新视角:基于预训练的网格拼图表示(pGJR)。受人类拼图处理的启发,我们修改传统拼图学习以获得对图像结构更顺序化、递增式的理解。我们还利用预训练的 CLIP 提取先验特征,其可受益于增强的跨模态表示,从而获得更丰富、更细微的语义信息及标签级区分。我们的实验表明,使用预训练模型作为特征提取器可加速聚类收敛。我们在 pGJR 上附加 GJR 模块,并在常用基准数据集上观察到显著提升。实验结果突显了我们的方法在聚类任务中的有效性,ACC、NMI 与 ARI 指标的提升及超快收敛速度即为佐证。

关键词

引用

@article{arxiv.2310.17869,
  title  = {Grid Jigsaw Representation with CLIP: A New Perspective on Image Clustering},
  author = {Zijie Song and Zhenzhen Hu and Richang Hong},
  journal= {arXiv preprint arXiv:2310.17869},
  year   = {2025}
}