中文

使用视觉-语言模型的小样本类增量学习

计算机视觉与模式识别 2024-08-16 v2 计算与语言 图像与视频处理

摘要

深度学习的最新进展展示了在各种监督计算机视觉任务中可与人类能力相媲美的卓越性能。然而,普遍假设在模型训练之前拥有涵盖所有类别的大量训练数据池,这往往与现实场景不符,在现实中新类别的可用数据有限是常态。挑战在于如何将具有少量样本的新类别无缝整合到训练数据中,要求模型能够熟练地适应这些新增内容而不损害其在基类上的性能。为了应对这一迫切需求,研究界在小样本类增量学习(FSCIL)领域提出了几种解决方案。在本研究中,我们引入了一个创新的 FSCIL 框架,该框架利用语言正则化器和子空间正则化器。在基础训练期间,语言正则化器有助于整合从视觉-语言模型中提取的语义信息。子空间正则化器有助于在增量训练期间促进模型获取基类固有的图像与文本语义之间的细微联系。我们提出的框架不仅使模型能够接纳数据有限的新类别,而且确保了对基类性能的保持。为了验证我们方法的有效性,我们在三个不同的 FSCIL 基准上进行了全面实验,其中我们的框架实现了 SOTA 性能。

关键词

引用

@article{arxiv.2405.01040,
  title  = {Few Shot Class Incremental Learning using Vision-Language models},
  author = {Anurag Kumar and Chinmay Bharti and Saikat Dutta and Srikrishna Karanam and Biplab Banerjee},
  journal= {arXiv preprint arXiv:2405.01040},
  year   = {2024}
}