中文

自监督学习成功背后的图像块嵌入包

计算机视觉与模式识别 2023-06-14 v2 机器学习

摘要

自监督学习 (SSL) 近期在学习图像表示方面取得了巨大的实证进展。然而,我们对学习此类表示背后的原理理解仍然有限。本工作表明,联合嵌入 SSL 方法主要学习反映图像块共现关系的图像块表示。这种与共现建模的联系可以被形式化地建立,它补充了当前主流的不变性视角。我们通过实证表明,为固定尺度的图像块学习表示,并将局部图像块表示聚合为图像表示,能够取得与基线方法相似甚至更好的结果。我们将此过程记为 BagSSL。即使使用 32x32 的图像块表示,BagSSL 在 ImageNet 上也取得了 62% 的 top-1 线性探测准确率。另一方面,使用多尺度预训练模型,我们展示了全图嵌入近似等于局部图像块嵌入的平均值。尽管 SSL 表示在全局尺度上相对不变,但我们表明当放大到局部图像块级表示时,局部性得到了保留。此外,我们展示了图像块表示聚合能够大幅提升各种 SOTA 基线方法。图像块表示相当容易理解,本工作向揭开自监督表示学习的神秘面纱迈出了一步。

关键词

引用

@article{arxiv.2206.08954,
  title  = {Bag of Image Patch Embedding Behind the Success of Self-Supervised Learning},
  author = {Yubei Chen and Adrien Bardes and Zengyi Li and Yann LeCun},
  journal= {arXiv preprint arXiv:2206.08954},
  year   = {2023}
}