中文

面向细粒度数据集的多模态少样本类增量学习的精简方法

计算机视觉与模式识别 2024-03-12 v1

摘要

少样本类增量学习 (FSCIL) 面临的挑战在于:在从有限的新数据流中学习的同时保留先验知识,且不发生过拟合。视觉语言模型 (VLMs) 的兴起解锁了大量应用,利用其已有知识在自定义数据上进行微调。然而,训练整个模型在计算上是不可行的,而且 VLMs 虽然在通用领域表现出色,但对于许多应用至关重要的细粒度数据集仍然难以应对。我们通过提出两个简单模块来解决这些挑战。第一个是会话特定提示 (SSP),用于增强跨会话的图像-文本嵌入的可分性。第二个是双曲距离,用于压缩同一类内的图像-文本对表示,同时扩大不同类的表示,从而获得更好的表示。实验结果表明,与基线相比平均提升了 10 个百分点,同时所需的可训练参数至少减少了 8 倍。在我们新引入的三个细粒度数据集上进一步凸显了这一改进。

关键词

引用

@article{arxiv.2403.06295,
  title  = {A streamlined Approach to Multimodal Few-Shot Class Incremental Learning for Fine-Grained Datasets},
  author = {Thang Doan and Sima Behpour and Xin Li and Wenbin He and Liang Gou and Liu Ren},
  journal= {arXiv preprint arXiv:2403.06295},
  year   = {2024}
}