基于 CLIP 的网格拼图表示:图像聚类的新视角
计算机视觉与模式识别
2025-02-14 v2
摘要
面向图像聚类的无监督表示学习在计算机视觉中至关重要。尽管视觉模型的进步以高效的视觉表示改进了图像聚类,挑战依然存在。首先,现有特征常缺乏表示图像内部结构的能力,阻碍了对视觉相似图像的准确聚类。其次,更细粒度的语义标签常缺失,限制了对图像间细微差异与相似性的捕捉能力。本文中,我们提出图像聚类的新视角:基于预训练的网格拼图表示(pGJR)。受人类拼图处理的启发,我们修改传统拼图学习以获得对图像结构更顺序化、递增式的理解。我们还利用预训练的 CLIP 提取先验特征,其可受益于增强的跨模态表示,从而获得更丰富、更细微的语义信息及标签级区分。我们的实验表明,使用预训练模型作为特征提取器可加速聚类收敛。我们在 pGJR 上附加 GJR 模块,并在常用基准数据集上观察到显著提升。实验结果突显了我们的方法在聚类任务中的有效性,ACC、NMI 与 ARI 指标的提升及超快收敛速度即为佐证。
引用
@article{arxiv.2310.17869,
title = {Grid Jigsaw Representation with CLIP: A New Perspective on Image Clustering},
author = {Zijie Song and Zhenzhen Hu and Richang Hong},
journal= {arXiv preprint arXiv:2310.17869},
year = {2025}
}