中文

基于跨模态语义一致性的自增强图像聚类

计算机视觉与模式识别 2025-08-05 v1

摘要

虽然大型语言图像预训练模型如CLIP为图像聚类提供了强大的通用特征,但现有方法通常会冻结编码器。这导致模型的任务无关表征与特定聚类任务的需求之间存在根本性不匹配,限制了性能的提升。为突破这一瓶颈,我们提出了一种基于跨模态语义一致性的自增强框架,用于高效图像聚类。我们的框架首先通过跨模态语义一致性构建强大的基础,然后通过自增强来专门化编码器。在第一个阶段,我们聚焦于跨模态语义一致性。通过在实例、聚类分配和聚类中心水平上挖掘生成的图像-文本对之间的一致性,我们训练轻量级聚类头部以与预训练模型的丰富语义保持一致。这种对齐过程由一种新型的聚类中心生成方法和动态平衡正则化器得到支撑,以确保分配的良好分布。在第二个阶段,我们引入一种自增强微调策略。来自第一个阶段的良好对齐模型作为可靠的伪标签生成器。这些自生成的监督信号随后用于反馈视觉编码器和聚类头部的高效联合优化,释放其全部潜能。在六个主流数据集上的大量实验表明,我们的方法在现有深度聚类方法上显著取得优势。值得注意的是,我们的ViT-B/32模型已经可以匹配甚至超越基于更大规模ViT-L/14的当前最先进方法。

关键词

引用

@article{arxiv.2508.01254,
  title  = {Self-Enhanced Image Clustering with Cross-Modal Semantic Consistency},
  author = {Zihan Li and Wei Sun and Jing Hu and Jianhua Yin and Jianlong Wu and Liqiang Nie},
  journal= {arXiv preprint arXiv:2508.01254},
  year   = {2025}
}