一种出奇简单的控制预训练偏置以提升迁移性能的技术:扩展或收窄你的表征
机器学习
2023-04-12 v1
摘要
自监督学习(SSL)模型依赖一个 pretext task( pretext 任务)来学习表征。由于该 pretext 任务不同于用于评估这些模型性能的下游任务,存在固有的错位或预训练偏置。SSL中一种被证明能使深度网络对这种偏置更鲁棒的常用技巧是:在训练期间于骨干网络之上添加一个小型投影器(通常是一个2或3层多层感知机)。与以往研究投影器架构影响的工作不同,我们在此关注一个更简单却被忽视的杠杆来控制骨干表征中的信息。我们表明,仅改变其维度——通过仅改变骨干网络最末块的尺寸——是一种减轻预训练偏置的极其有效的技术。它显著提升了自监督与有监督预训练模型的下游迁移性能。
引用
@article{arxiv.2304.05369,
title = {A surprisingly simple technique to control the pretraining bias for better transfer: Expand or Narrow your representation},
author = {Florian Bordes and Samuel Lavoie and Randall Balestriero and Nicolas Ballas and Pascal Vincent},
journal= {arXiv preprint arXiv:2304.05369},
year = {2023}
}