中文

不要停止学习:面向 CLIP 模型的持续学习

计算机视觉与模式识别 2022-07-21 v2

摘要

对比语言-图像预训练 (CLIP) 模型是近期提出的大规模预训练模型,在计算机视觉界受到越来越多的关注。得益于其庞大的图像-文本训练集,CLIP 模型已学习到出色的零样本学习与图像-文本匹配能力。为提升 CLIP 在某些目标视觉概念上的识别性能,通常期望通过在额外训练数据上微调若干感兴趣类别来进一步更新 CLIP 模型。然而,该操作引发一个重要关切:更新是否会损害 CLIP 的零样本学习或图像-文本匹配能力,即灾难性遗忘问题?若是,现有持续学习算法能否被改造以缓解灾难性遗忘风险?为回答这些问题,本工作对 CLIP 模型的持续学习问题进行了系统性研究。我们构建了评估协议以衡量微调更新的影响,并探索不同方式来升级现有持续学习方法以缓解 CLIP 模型的遗忘问题。我们的研究揭示了 CLIP 持续学习问题的特殊挑战,并为进一步研究奠定基础。此外,我们提出了一种新算法,称为通过重放词表的无遗忘学习 (VR-LwF),其在缓解 CLIP 模型遗忘问题上展现出确切有效性。

关键词

引用

@article{arxiv.2207.09248,
  title  = {Don't Stop Learning: Towards Continual Learning for the CLIP Model},
  author = {Yuxuan Ding and Lingqiao Liu and Chunna Tian and Jingyuan Yang and Haoxuan Ding},
  journal= {arXiv preprint arXiv:2207.09248},
  year   = {2022}
}

备注

12 pages, 5 figures