中文

大多数自监督学习方法背后的共同稳定性机制

计算机视觉与模式识别 2024-02-26 v1 机器学习

摘要

过去几年见证了自监督学习 (SSL) 的巨大进步,其成功可归因于在学习过程中引入了有用的归纳偏置,以学习有意义的视觉表示同时避免崩溃。这些归纳偏置和约束在 SSL 技术中表现为不同的优化公式,例如在对比公式中利用负样本,或在 BYOL 和 SimSiam 中使用指数移动平均和预测器。在本文中,我们提供了一个框架来解释这些不同 SSL 技术的稳定性机制:i) 我们讨论了对比技术(如 SimCLR)和非对比技术(如 BYOL、SWAV、SimSiam、Barlow Twins 和 DINO)的工作机制;ii) 我们提出一个论点,即尽管公式不同,这些方法隐式地优化了相似的目标函数,即最小化所有数据样本上期望表示的幅度(或数据分布的均值),同时最大化单个样本在不同数据增强下期望表示的幅度;iii) 我们提供数学和经验证据来支持我们的框架。我们制定了不同的假设并使用 Imagenet100 数据集进行了测试。

关键词

引用

@article{arxiv.2402.14957,
  title  = {The Common Stability Mechanism behind most Self-Supervised Learning Approaches},
  author = {Abhishek Jha and Matthew B. Blaschko and Yuki M. Asano and Tinne Tuytelaars},
  journal= {arXiv preprint arXiv:2402.14957},
  year   = {2024}
}

备注

Additional visualizations (.gif): https://github.com/abskjha/CenterVectorSSL