中文

HCSC:分层对比选择性编码

计算机视觉与模式识别 2022-05-24 v4

摘要

图像数据集中天然存在分层语义结构,其中若干语义相关的图像簇可进一步聚合成具有更粗粒度语义的更大簇。在图像表示中捕捉此类结构可极大裨益各类下游任务的语义理解。现有的对比表示学习方法缺乏这一重要模型能力。此外,这些方法所用的负样本对无法保证语义相异,可能进一步损害所学图像表示的结构正确性。为应对这些局限,我们提出一种称为分层对比选择性编码(HCSC)的新型对比学习框架。在该框架中,构建一组分层原型并动态更新,以在潜空间中表征数据背后的分层语义结构。为使图像表示更好地契合此类语义结构,我们采用并进一步改进传统的实例级与原型级对比学习,引入精细的样本对选择机制。该机制旨在选取语义相似且更多样的正样本对,以及语义真正相异且更精确的负样本对。在大量下游任务上,我们验证了 HCSC 相对于最先进对比方法的优越性能,并通过充分的分析研究证明了主要模型组件的有效性。我们在附录 D 中构建了全面的模型库。我们的源代码与模型权重可在 https://github.com/gyfastas/HCSC 获取。

关键词

引用

@article{arxiv.2202.00455,
  title  = {HCSC: Hierarchical Contrastive Selective Coding},
  author = {Yuanfan Guo and Minghao Xu and Jiawen Li and Bingbing Ni and Xuanyu Zhu and Zhenbang Sun and Yi Xu},
  journal= {arXiv preprint arXiv:2202.00455},
  year   = {2022}
}

备注

Accepted by CVPR 2022. arXiv v3: 800 epoch multi-crop model released; arXiv v2: more model weights released; arXiv v1: code & model weights released