缓解持续微调中的表征偏移
计算机视觉与模式识别
2022-05-10 v2 人工智能
摘要
我们研究一种实用的持续学习设定:在预训练模型上持续微调。已有工作发现,当在新任务上训练时,先前数据的特征(倒数第二层表征)会发生变化,称为表征偏移。除特征偏移外,我们揭示中间层的表征偏移(IRS)同样重要,因其破坏批归一化,是灾难性遗忘的另一关键成因。受此启发,我们提出 ConFiT,一种融合两组件的微调方法:跨卷积批归一化(Xconv BN)与分层微调。Xconv BN 维持卷积前而非卷积后的运行均值,并在测试前恢复卷积后均值,从而修正 IRS 下不准确的均值估计。分层微调采用多阶段策略微调预训练网络,防止 Conv 层大幅变动从而缓解 IRS。四个数据集上的实验表明,我们的方法以更低存储开销显著优于若干 SOTA 方法。
引用
@article{arxiv.2204.10535,
title = {Alleviating Representational Shift for Continual Fine-tuning},
author = {Shibo Jie and Zhi-Hong Deng and Ziheng Li},
journal= {arXiv preprint arXiv:2204.10535},
year = {2022}
}