中文

CrIBo:基于跨图像对象级引导的自监督学习

计算机视觉与模式识别 2024-03-05 v2 机器学习

摘要

利用最近邻检索进行自监督表示学习已在以对象为中心的图像上被证明有益。然而,当应用于以场景为中心的数据集时,该方法面临局限,因为图像中多个对象仅在全局表示中被隐式捕获。这种全局引导可能导致对象表示出现不期望的纠缠。此外,即便是以对象为中心的数据集也能从更细粒度的引导方法中获益。为应对这些挑战,我们提出了一种新颖的跨图像对象级引导(Cross-Image Object-Level Bootstrapping)方法,旨在增强密集视觉表示学习。通过在训练过程中采用对象级最近邻引导,CrIBo 作为一个显著强大且充分的候选方法脱颖而出,可在测试时利用最近邻检索进行上下文学习(in-context learning)。CrIBo 在后者任务上展示了最先进的性能,同时在更标准的下游分割任务中极具竞争力。我们的代码与预训练模型公开于 https://github.com/tileb1/CrIBo。

关键词

引用

@article{arxiv.2310.07855,
  title  = {CrIBo: Self-Supervised Learning via Cross-Image Object-Level Bootstrapping},
  author = {Tim Lebailly and Thomas Stegmüller and Behzad Bozorgtabar and Jean-Philippe Thiran and Tinne Tuytelaars},
  journal= {arXiv preprint arXiv:2310.07855},
  year   = {2024}
}

备注

ICLR 2024 (spotlight)