中文

断头台正则化:为何移除层是自监督学习中提升泛化能力所必需的

机器学习 2023-06-12 v2

摘要

近年来出现的一种出人意料的技术是:用自监督学习(SSL)方法训练深度网络(DN),并在下游任务中使用该网络但将其最后几层投影器完全移除。这种丢弃投影器的技巧实际上对SSL方法在ImageNet上展现竞争力至关重要,借此可提升超过30个百分点。这有些令人困扰,因为人们本希望训练期间由SSL准则显式强制不变性的网络层(最后投影层)应是下游最佳泛化性能所用之层。但事实似乎并非如此,本研究对此原因有所阐明。这一我们命名为断头台正则化(GR)的技巧,实际上是一种通用方法,已用于提升迁移学习场景中的泛化性能。本工作中,我们确定了其成功背后的根本原因,并表明最优使用层可能随训练设置、数据或下游任务发生显著变化。最后,我们就如何通过对齐 pretext SSL 任务与下游任务来减少SSL中对投影器的需求给出了一些见解。

关键词

引用

@article{arxiv.2206.13378,
  title  = {Guillotine Regularization: Why removing layers is needed to improve generalization in Self-Supervised Learning},
  author = {Florian Bordes and Randall Balestriero and Quentin Garrido and Adrien Bardes and Pascal Vincent},
  journal= {arXiv preprint arXiv:2206.13378},
  year   = {2023}
}

备注

Accepted at TMLR 2023