中文

迁移学习中关于预训练不充分的模型研究

计算机视觉与模式识别 2023-08-21 v3

摘要

预训练在深度学习时代已成为一种流行的学习范式,尤其在标注不足的场景中。先前的研究从架构角度表明,更好的 ImageNet 预训练模型对下游任务具有更好的可迁移性。然而,在本文中,我们发现,在同一预训练过程中,作为特征提取器(FE)使用时,处于中间轮次、即预训练不充分的模型可以优于完全训练的模型,而微调(FT)性能仍随源性能增长。这表明 ImageNet 上的 top-1 准确率与目标数据上的迁移结果之间并不存在稳固的正相关。基于 FE 与 FT 之间“更好的特征提取器未能对应更好地微调”的矛盾现象,我们对 softmax 层之前的特征进行了全面分析,以提供深入的阐释。我们的发现表明,在预训练期间,模型倾向于首先学习与较大奇异值对应的谱分量,而残差分量在微调时贡献更多。

关键词

引用

@article{arxiv.2203.04668,
  title  = {Towards Inadequately Pre-trained Models in Transfer Learning},
  author = {Andong Deng and Xingjian Li and Di Hu and Tianyang Wang and Haoyi Xiong and Chengzhong Xu},
  journal= {arXiv preprint arXiv:2203.04668},
  year   = {2023}
}

备注

Accepted by ICCV'2023