视觉 Transformer 微调过程中发生了什么:一项基于不变性的探究
计算机视觉与模式识别
2023-07-13 v1 机器学习
摘要
预训练-微调范式通常能比在相同任务上从零训练模型提升下游性能,已成为机器学习诸多领域的惯例。尽管经验上观察到预训练对一系列任务有益,但迄今尚未清晰理解该效应的原因。本文中,我们考察了多个基准数据集与任务上预训练视觉 Transformer 与其对应微调版本间的关系。我们提出专门探究预训练模型所学不变性在微调中被保留或遗忘程度的新指标。利用这些指标,我们给出一系列经验发现,包括预训练在浅层诱导可迁移的不变性,以及更深预训练层的不变性在微调中被压缩至更浅层。这些发现共同有助于理解预训练模型成功的部分原因,以及预训练模型在下游任务微调时所经历的变化。
引用
@article{arxiv.2307.06006,
title = {What Happens During Finetuning of Vision Transformers: An Invariance Based Investigation},
author = {Gabriele Merlin and Vedant Nanda and Ruchit Rawal and Mariya Toneva},
journal= {arXiv preprint arXiv:2307.06006},
year = {2023}
}
备注
Accepted to CoLLAs 2023