基于残差动量的自监督视觉表征学习
计算机视觉与模式识别
2022-11-22 v2
摘要
自监督学习(SSL)方法在从无标注数据中学习表征方面展现出良好能力。其中,基于动量的框架引起了广泛关注。尽管取得巨大成功,这些基于动量的 SSL 框架仍受限于在线编码器(学生)与动量编码器(教师)之间表征上的较大差距,这阻碍了下游任务的性能。本文首次研究并将这一隐性差距确定为现有 SSL 框架中被忽视的瓶颈,其可能阻碍模型学习良好表征。为解决该问题,我们提出“残差动量”以直接缩小此差距,鼓励学生尽可能学习接近教师的表征,缩小与教师的性能差距,并显著改进现有 SSL。我们的方法简洁、易于实现,且可便捷地插入其他 SSL 框架。在众多基准数据集和多样网络架构上的大量实验结果,证明了我们的方法相对于最先进的对比学习基线的有效性。
引用
@article{arxiv.2211.09861,
title = {Self-Supervised Visual Representation Learning via Residual Momentum},
author = {Trung X. Pham and Axi Niu and Zhang Kang and Sultan Rizky Madjid and Ji Woo Hong and Daehyeok Kim and Joshua Tian Jin Tee and Chang D. Yoo},
journal= {arXiv preprint arXiv:2211.09861},
year = {2022}
}
备注
18 pages, 16 figures