理解非对比孪生表征学习中的坍缩现象
机器学习
2022-11-03 v2 人工智能
计算机视觉与模式识别
神经与进化计算
机器人学
摘要
对比方法近期推动了自监督表征学习(SSL)性能的提升。诸如BYOL或SimSiam之类的方法声称将这些对比方法提炼至其本质,去除了对下游性能无贡献的附加成分,包括负样本。这些“非对比”方法即便不使用负样本也出奇地有效,尽管其全局最小值对应于平凡的坍缩。我们实证分析了这些非对比方法,发现SimSiam对数据集和模型大小极其敏感。特别地,若模型相对于数据集大小过小,SimSiam表征会发生部分维度坍缩。我们提出了一种度量该坍缩程度的指标,并表明其可用于在不进行任何微调或依赖标签的情况下预测下游任务性能。我们进一步分析了架构设计选择及其对下游性能的影响。最后,我们证明转向持续学习设定可起到正则化作用并防止坍缩,且持续学习与多轮训练的混合方法在使用ResNet-18于ImageNet上可将线性探测准确率提升多达18个百分点。我们的项目页面位于 https://alexanderli.com/noncontrastive-ssl/。
引用
@article{arxiv.2209.15007,
title = {Understanding Collapse in Non-Contrastive Siamese Representation Learning},
author = {Alexander C. Li and Alexei A. Efros and Deepak Pathak},
journal= {arXiv preprint arXiv:2209.15007},
year = {2022}
}
备注
Published at ECCV 2022. Project page at https://alexanderli.com/noncontrastive-ssl/