自监督视觉表征学习中动量编码器的优劣分析
计算机视觉与模式识别
2022-08-12 v1
摘要
指数移动平均(EMA 或动量)在现代自监督学习(SSL)方法(如 MoCo)中被广泛使用以增强性能。我们证明此类动量也可嵌入无动量的 SSL 框架(如 SimCLR)中以提升性能。尽管动量作为现代 SSL 框架的基本组件被广泛使用,其所带来的益处尚未被充分理解。我们发现其成功至少可部分归因于稳定性效应。在首次尝试中,我们分析了 EMA 如何影响编码器的各个部分,并揭示靠近编码器输入的部分作用不显著,而后续部分影响更大。通过监测整体损失相对于编码器各块输出的梯度,我们观察到在反向传播过程中最终层相较于其他层波动大得多,即稳定性更差。有趣的是,我们展示仅对 SSL 编码器的最后部分(即投影头 projector)使用 EMA,而非整个深度网络编码器,可取得相当或更优的性能。我们提出的仅投影头动量有助于保持 EMA 的益处,同时避免双重前向计算。
引用
@article{arxiv.2208.05744,
title = {On the Pros and Cons of Momentum Encoder in Self-Supervised Visual Representation Learning},
author = {Trung Pham and Chaoning Zhang and Axi Niu and Kang Zhang and Chang D. Yoo},
journal= {arXiv preprint arXiv:2208.05744},
year = {2022}
}
备注
35 pages