中文

用于对比聚类的视觉Transformer

计算机视觉与模式识别 2022-07-12 v2 机器学习

摘要

视觉Transformer (ViT) 凭借其捕捉全局长程依赖以进行视觉表征学习的能力,已展现出相对于卷积神经网络 (CNN) 的优势。除 ViT 外,对比学习是近期另一个热门研究课题。虽然以往的对比学习工作大多基于 CNN,但一些近期研究尝试将 ViT 与对比学习结合以增强自监督学习。尽管取得了可观进展,这些 ViT 与对比学习的结合大多聚焦于实例级对比性,往往忽视了全局对比性,且缺乏直接学习聚类结果(例如针对图像)的能力。鉴于此,本文提出一种新颖的深度聚类方法,称为用于对比聚类的视觉Transformer (VTCC);据我们所知,该方法首次将 Transformer 与对比学习统一用于图像聚类任务。具体而言,对每幅图像进行两次随机增强后,我们采用具有两个权值共享视图的 ViT 编码器作为骨干网络。为弥补 ViT 潜在的不稳定性,我们引入卷积干 (convolutional stem) 将每个增强样本切分为图像块序列,其在块投影层中使用多个堆叠的小卷积而非一个大卷积。通过骨干网络学习图像块序列的特征表示,进一步利用实例投影器和聚类投影器分别执行实例级对比学习与全局聚类结构学习。在八个图像数据集上的实验证明了我们的 VTCC 方法在(从头训练期间的)稳定性以及(聚类性能上的)优越性优于当前最优方法。

关键词

引用

@article{arxiv.2206.12925,
  title  = {Vision Transformer for Contrastive Clustering},
  author = {Hua-Bao Ling and Bowen Zhu and Dong Huang and Ding-Hua Chen and Chang-Dong Wang and Jian-Huang Lai},
  journal= {arXiv preprint arXiv:2206.12925},
  year   = {2022}
}