中文

预训练视觉与语言 Transformer 是少样本增量学习者

计算机视觉与模式识别 2024-04-03 v1

摘要

少样本类增量学习(FSCIL)是一项要求模型在每个类别仅给定少量样本的情况下,增量学习新类且不遗忘的任务。FSCIL 面临两个重大挑战:灾难性遗忘和过拟合,这些挑战促使先前的研究主要依赖于浅层模型,例如 ResNet-18。尽管其有限的容量可以缓解遗忘和过拟合问题,但这会导致在少样本增量会话期间的知识转移不充分。在本文中,我们认为在大型数据集上预训练的大型模型(如视觉与语言 Transformer)可以成为优秀的少样本增量学习者。为此,我们提出了一种名为 PriViLege 的新型 FSCIL 框架,即结合提示函数和知识蒸馏的预训练视觉与语言 Transformer。我们的框架通过新的预训练知识调优(PKT)以及两种损失函数:基于熵的散度损失和语义知识蒸馏损失,有效地解决了大型模型中灾难性遗忘和过拟合的挑战。实验结果表明,所提出的 PriViLege 以较大优势显著优于现有的 SOTA 方法,例如在 CUB200 上提升 +9.38%,在 CIFAR-100 上提升 +20.58%,在 miniImageNet 上提升 +13.36%。我们的实现代码可在 https://github.com/KHU-AGI/PriViLege 获取。

关键词

引用

@article{arxiv.2404.02117,
  title  = {Pre-trained Vision and Language Transformers Are Few-Shot Incremental Learners},
  author = {Keon-Hee Park and Kyungwoo Song and Gyeong-Moon Park},
  journal= {arXiv preprint arXiv:2404.02117},
  year   = {2024}
}

备注

Accepted by CVPR 2024