中文

用于自监督视觉表征学习的密集语义对比

计算机视觉与模式识别 2021-09-17 v1

摘要

用于视觉预训练的自监督表征学习通过样本(实例或像素)判别与实例语义发现取得了显著成功,但预训练模型与下游密集预测任务之间仍存在不可忽略的差距。具体而言,这些下游任务需要更精确的表征,即同一对象的像素必须属于共享语义类别,而先前方法缺乏这一点。本工作中,我们提出密集语义对比(DSC)以在密集层级建模语义类别决策边界,满足此类任务需求。此外,我们提出一个用于多粒度表征学习的密集跨图像语义对比学习框架。特别地,我们从不同视角挖掘像素间关系,显式探索数据集的语义结构。对于图像内关系建模,我们从多视图发现像素邻域;对于图像间关系,我们在一个 mini-batch 中强制同一语义类的像素表征比不同类的表征更相似。实验结果表明,当迁移至下游密集预测任务(包括目标检测、语义分割与实例分割)时,我们的 DSC 模型优于 SOTA 方法。代码将公开。

关键词

引用

@article{arxiv.2109.07756,
  title  = {Dense Semantic Contrast for Self-Supervised Visual Representation Learning},
  author = {Xiaoni Li and Yu Zhou and Yifei Zhang and Aoting Zhang and Wei Wang and Ning Jiang and Haiying Wu and Weiping Wang},
  journal= {arXiv preprint arXiv:2109.07756},
  year   = {2021}
}

备注

ACM MM 2021 Oral