中文

基于原型散射与正采样学习的聚类表示

计算机视觉与模式识别 2022-11-08 v2

摘要

现有的深度聚类方法要么依赖对比式、要么依赖非对比式表示学习来完成下游聚类任务。基于对比的方法借助负样本对为聚类学习到均匀的表示,然而负样本对可能不可避免地导致类碰撞问题,从而损害聚类性能。另一方面,非对比式方法避免了类碰撞问题,但所得非均匀表示可能导致聚类崩溃。为了兼取两者之长,本文提出一种新颖的端到端深度聚类方法,采用原型散射与正采样,称为 ProPos。具体而言,我们首先最大化原型表示之间的距离,称为原型散射损失,从而提升表示的均匀性。其次,我们将一个增强视图中的实例与另一视图的采样邻域对齐——假定为嵌入空间中真正的正样本对——以提升类内紧致性,称为正采样对齐。ProPos 的优势在于可避免类碰撞问题、表示均匀、簇间分离良好以及类内紧致。通过在端到端期望最大化框架中优化 ProPos,大量实验结果表明 ProPos 在中等规模聚类基准数据集上取得了有竞争力的性能,并在大规模数据集上确立了新的 SOTA 性能。源代码见 \url{https://github.com/Hzzone/ProPos}。

关键词

引用

@article{arxiv.2111.11821,
  title  = {Learning Representation for Clustering via Prototype Scattering and Positive Sampling},
  author = {Zhizhong Huang and Jie Chen and Junping Zhang and Hongming Shan},
  journal= {arXiv preprint arXiv:2111.11821},
  year   = {2022}
}

备注

Accepted by TPAMI 2022