一种理论驱动的对比表示学习自标注精炼方法
计算机视觉与模式识别
2021-06-29 v1 人工智能
机器学习
最优化与控制
摘要
对于图像查询,无监督对比学习将同一图像的裁剪标为正样本,其他图像裁剪标为负样本。尽管直观,这种原生标注分配策略无法揭示查询与其正负样本间潜在的语义相似性,并损害性能,因为某些负样本与查询语义相似甚至共享同一语义类。本工作中,我们首先证明对对比学习而言,不准确的标注分配严重损害其语义实例判别的泛化能力,而准确标注有益于其泛化。受该理论启发,我们提出一种新颖的对比学习自标注精炼方法。它通过两个互补模块提升标注质量:(i) 自标注精炼(SLR)生成准确标注;(ii) 动量混合(MM)增强查询与其正样本的相似性。SLR 利用查询的正样本估计查询与其正负样本间的语义相似性,并将估计相似性与对比学习中的原生标注分配结合,迭代生成更准确且信息更丰富的软标注。我们从理论上证明我们的 SLR 能精确恢复标注损坏数据的真实语义标签,并监督网络在分类任务上实现零预测误差。MM 随机组合查询与正样本以增加生成的虚拟查询与其正样本间的语义相似性,从而提高标注准确性。在 CIFAR10、ImageNet、VOC 和 COCO 上的实验结果展示了我们方法的有效性。PyTorch 代码与模型将在线发布。
引用
@article{arxiv.2106.14749,
title = {A Theory-Driven Self-Labeling Refinement Method for Contrastive Representation Learning},
author = {Pan Zhou and Caiming Xiong and Xiao-Tong Yuan and Steven Hoi},
journal= {arXiv preprint arXiv:2106.14749},
year = {2021}
}
备注
under review. arXiv admin note: substantial text overlap with arXiv:1903.11680 by other authors