中文

多模态深度聚类:图像的无监督划分

计算机视觉与模式识别 2020-12-16 v3

摘要

无标签原始图像的聚类是一项艰巨任务,近来深度学习方法已在一定程度上成功应对。此处我们提出一个无监督聚类框架,以端到端方式训练深度神经网络,直接给出图像聚类分配而无需额外处理。多模态深度聚类(MMDC)训练深度网络将其图像嵌入与从高斯混合模型分布采样的目标点对齐。聚类分配随后由图像嵌入的混合分量关联确定。同时,同一深度网络被训练以求解预测图像旋转的额外自监督任务。这推动网络学习更有意义的图像表示,从而促成更好的聚类。实验结果表明,MMDC在六个具挑战性基准上达到或超越state-of-the-art性能。在自然图像数据集上,我们以高达20%绝对精度点的显著优势改进先前结果,在CIFAR-10上获得82%精度、CIFAR-100上45%、STL-10上69%。

关键词

引用

@article{arxiv.1912.02678,
  title  = {Multi-Modal Deep Clustering: Unsupervised Partitioning of Images},
  author = {Guy Shiran and Daphna Weinshall},
  journal= {arXiv preprint arXiv:1912.02678},
  year   = {2020}
}

备注

Accepted to ICPR 2020