中文

QK 迭代:一种用于图像相似性的自监督表示学习算法

计算机视觉与模式识别 2021-11-16 v1

摘要

自监督表示学习是计算机视觉中的一个基础问题,具有许多有用应用(例如图像检索、实例级识别、拷贝检测)。本文中,我们在 Facebook AI Research 主办的 2021 图像相似性挑战赛的拷贝检测背景下,提出一种新的对比自监督表示学习算法。先前对比自监督学习的工作已确认能够在优化表示时对抗大量负例进行“推离”的重要性。代表性的先前方案要么利用现代分布式训练系统支持的大批量,要么维护保存近期评估表示的队列或记忆库,同时放松某些一致性性质。我们从一个新角度处理该问题:我们直接联合学习一个查询模型与一个键模型,并在每个 SGD 步中对抗极大量(例如 100 万)负表示进行推离。我们通过冻结一侧的主干网络并在 Q 优化步与 K 优化步之间交替来实现这一点。在比赛期间,我们的算法在阶段 1 排行榜上取得了 0.3401 的 micro-AP 分数,相比基线 μ\muAP 0.1556 显著提升。在最终阶段 2 排行榜上,我们的模型得分为 0.1919,而基线为 0.0526。持续训练带来了进一步改进。我们进行了实证研究,将所提方法与仅从批量中取负例的 SimCLR 风格策略比较。我们发现我们的方法(μ\muAP 0.3403)显著优于该 SimCLR 风格基线(μ\muAP 0.2001)。

关键词

引用

@article{arxiv.2111.07954,
  title  = {QK Iteration: A Self-Supervised Representation Learning Algorithm for Image Similarity},
  author = {David Wu and Yunnan Wu},
  journal= {arXiv preprint arXiv:2111.07954},
  year   = {2021}
}