微调会扭曲预训练特征并在分布外表现更差
机器学习
2022-02-24 v1 计算机视觉与模式识别
摘要
当将预训练模型迁移到下游任务时,两种流行的方法是全微调(更新所有模型参数)和线性探测(仅更新最后一层线性层——即“头”)。众所周知,微调能在分布内(ID)获得更好的准确率。然而,在本文中我们发现,当预训练特征良好且分布偏移较大时,微调在分布外(OOD)的准确率可能比线性探测更差。在 10 个分布偏移数据集(Breeds-Living17、Breeds-Entity30、DomainNet、CIFAR → STL、CIFAR10.1、FMoW、ImageNetV2、ImageNet-R、ImageNet-A、ImageNet-Sketch)上,微调平均 ID 准确率高出 2%,但 OOD 准确率比线性探测低 7%。我们理论上证明,即使在简单设定下——微调过参数化两层线性网络——这种 ID 与 OOD 准确率之间的权衡也会出现。我们证明,当以固定或随机头初始化时,微调的 OOD 误差较高——这是因为微调在学习头的同时,神经网络的较低层同时改变并扭曲了预训练特征。我们的分析表明,线性探测后全微调(LP-FT)这一有时用作微调启发式的简单两步策略,结合了微调与线性探测两者的优点。在经验上,LP-FT 在上述数据集上优于微调和线性探测(比全微调 ID 高 1%,OOD 高 10%)。
引用
@article{arxiv.2202.10054,
title = {Fine-Tuning can Distort Pretrained Features and Underperform Out-of-Distribution},
author = {Ananya Kumar and Aditi Raghunathan and Robbie Jones and Tengyu Ma and Percy Liang},
journal= {arXiv preprint arXiv:2202.10054},
year = {2022}
}
备注
ICLR (Oral) 2022