通过多次融合-增强ViT块提升对比聚类性能
计算机视觉与模式识别
2025-11-13 v1
摘要
在图像聚类领域,广泛使用的对比学习网络通过最大化正对的相似性和最小化负对的相似性来提高聚类性能。现有的对比学习网络,两个编码器往往通过参数共享或动量更新方式隐式相互作用,可能未充分利用正对的互补性和相似性来从输入数据中提取聚类特征。为了显式融合正对所学习的特征,我们设计了一种基于Vision Transformer(ViT)卓越特征学习能力的 novel multiple fusing-augmenting ViT blocks(MFAVBs)。首先,两个预处理的增强作为正对分别输入到两个共享权重的ViT中,然后将其输出特征融合输入到更大的ViT中。其次,将所学习的特征分割为一对新的增强正样本,传递到下一个FAVBs,从而通过MFAVBs操作实现多次融合和增强。最后,将所学习的特征投射到实例级和聚类级空间以计算交叉熵损失,随后通过反向传播进行参数更新以完成训练过程。为了进一步增强模型区分相似图像的能力,我们提出的网络输入数据是预处理的增强,这些增强来自CLIP预训练模型提取的特征。我们在七个公开数据集上的实验表明,MFAVBs作为对比聚类的 backbone 相较于最新技术在聚类性能方面表现更优。
引用
@article{arxiv.2511.08883,
title = {Improve Contrastive Clustering Performance by Multiple Fusing-Augmenting ViT Blocks},
author = {Cheng Wang and Shuisheng Zhou and Fengjiao Peng and Jin Sheng and Feng Ye and Yinli Dong},
journal= {arXiv preprint arXiv:2511.08883},
year = {2025}
}