保持轻量!基于无文本适配器的图像聚类简化
计算机视觉与模式识别
2025-12-23 v2 机器学习
神经与进化计算
统计计算
机器学习
摘要
在预训练模型时代,有效的分类通常可以通过简单的线性探测或轻量级读取层实现。相比之下,许多竞争性的聚类管道采用多模态设计,利用大语言模型(LLM)或其他文本编码器,以及文本-图像配对,而这些在实际下游应用中往往不可得。此外,这类框架通常难以训练,需大量计算资源,使其难以广泛采用。本文证明,在深度聚类中,使用无文本且高度简化的训练管道即可达到与更复杂最新方法相当的性能。具体而言,我们的方法称为通过预训练模型实现简单聚类(Simple Clustering via Pre-trained models, SCP),仅训练小型聚类头,同时利用预训练视觉模型的特征表示和正样本数据对。实验在包括 CIFAR-10、CIFAR-20、CIFAR-100、STL-10、ImageNet-10 和 ImageNet-Dogs 在内的基准数据集上进行,表明 SCP 能实现高度具竞争力的性能。此外,我们提供了一个理论结果,解释在理想条件下,为何至少在视觉领域实现优异聚类性能时,可能并不需要额外的文本基嵌入。
引用
@article{arxiv.2502.04226,
title = {Keep It Light! Simplifying Image Clustering Via Text-Free Adapters},
author = {Yicen Li and Haitz Sáez de Ocáriz Borde and Anastasis Kratsios and Paul D. McNicholas},
journal= {arXiv preprint arXiv:2502.04226},
year = {2025}
}