中文

基于动量的强零样本模型权重插值在持续学习中的应用

机器学习 2022-11-08 v1 计算机视觉与模式识别

摘要

大型预训练、具备零样本能力的模型在标准迁移与适配任务中均取得了显著成功,并对分布偏移表现出特别的鲁棒性。此外,后续的微调可以显著提升其在选定下游任务上的性能。然而,通过朴素微调,这些零样本模型会丧失其对分布偏移的泛化能力与鲁棒性。这对于持续学习(CL)等任务尤为棘手,因为随着新任务分布按顺序引入,必须持续进行适配。在本工作中,我们展示了在微调不足以适配此类零样本能力模型的情况下,简单的基于动量的权重插值能够在无记忆与基于记忆的设置下为 CL 任务提供一致的改进。具体而言,我们在标准 CL 基准上发现了超过 +4%+4\% 的提升,同时将误差相对于在所有任务上联合训练一次的上限在部分情况下减少一半以上,使持续学习器逐步逼近联合训练极限。

关键词

引用

@article{arxiv.2211.03186,
  title  = {Momentum-based Weight Interpolation of Strong Zero-Shot Models for Continual Learning},
  author = {Zafir Stojanovski and Karsten Roth and Zeynep Akata},
  journal= {arXiv preprint arXiv:2211.03186},
  year   = {2022}
}

备注

First Workshop on Interpolation Regularizers and Beyond, NeurIPS 2022 (Spotlight) and Workshop on Distribution Shifts, NeurIPS 2022