中文

重新审视自监督学习视觉表示的评估协议

计算机视觉与模式识别 2023-04-10 v1 机器学习

摘要

在上游带标签数据集(如 ImageNet)上的线性探测(LP)(和 kk-NN)以及向各种下游数据集的迁移学习(TL)通常被用于评估通过自监督学习(SSL)学到的视觉表示的质量。尽管现有 SSL 方法在这些评估协议下已展现出良好性能,我们观察到这些性能对 LP 和 TL 中涉及的超参数非常敏感。我们认为这是一种不良现象,因为真正通用的表示应当易于适配任何其他视觉识别任务,即学到的表示应当对 LP 和 TL 超参数的设置具有鲁棒性。在本工作中,我们通过使用最先进 SSL 方法进行大量实验来探究性能敏感性的成因。首先,我们发现 LP 的输入归一化对于消除随超参数变化而产生的性能差异至关重要。具体而言,在将输入送入线性分类器之前进行批归一化可显著提升评估的稳定性,并解决 kk-NN 与 LP 指标的不一致性。其次,对于 TL,我们证明 SSL 中的权重衰减参数显著影响所学表示的迁移能力,而这一点无法通过在上游数据集上的 LP 或 kk-NN 评估来识别。我们相信本研究的发现将通过引起学界对当前 SSL 评估方案缺陷的关注并强调重新考量它们的必要性而惠及社区。

关键词

引用

@article{arxiv.2304.03456,
  title  = {Rethinking Evaluation Protocols of Visual Representations Learned via Self-supervised Learning},
  author = {Jae-Hun Lee and Doyoung Yoon and ByeongMoon Ji and Kyungyul Kim and Sangheum Hwang},
  journal= {arXiv preprint arXiv:2304.03456},
  year   = {2023}
}