中文

理解无对比对的自我监督学习动态

机器学习 2021-10-11 v4 人工智能 计算机视觉与模式识别

摘要

虽然自我监督学习(SSL)的对比方法通过最小化同一数据点两个增广视图(正对)之间的距离并最大化不同数据点视图(负对)之间的距离来学习表示,但近期的\emph{非对比} SSL(例如 BYOL 与 SimSiam)在\emph{没有}负对的情况下仍展现出卓越性能,其关键在于额外的可学习预测器与停止梯度操作。一个根本性问题随之产生:为何这些方法不会坍缩为平凡表示?我们通过简单的理论研究回答了该问题,并提出了一种新方法 DirectPred,它\emph{直接}基于其输入的统计量设定线性预测器,无需梯度训练。在 ImageNet 上,其性能与采用 BatchNorm 的更复杂两层非线性预测器相当,并在 300 轮训练(以及 60 轮训练中的 5%5\%)中比线性预测器高出 2.5%2.5\%。DirectPred 的动机源于我们对简单线性网络中非对比 SSL 非线性学习动态的理论研究。我们的研究从概念上揭示了非对比 SSL 方法如何学习、如何避免表示坍缩,以及预测器网络、停止梯度、指数移动平均与权重衰减等多重因素如何共同作用。我们的简练理论重现了 STL-10 与 ImageNet 中真实世界消融研究的结果。代码已发布于 https://github.com/facebookresearch/luckmatters/tree/master/ssl。

关键词

引用

@article{arxiv.2102.06810,
  title  = {Understanding self-supervised Learning Dynamics without Contrastive Pairs},
  author = {Yuandong Tian and Xinlei Chen and Surya Ganguli},
  journal= {arXiv preprint arXiv:2102.06810},
  year   = {2021}
}

备注

Fix minor typo in Appendix