中文

多模态参数高效少样本类增量学习

计算机视觉与模式识别 2024-01-09 v2 人工智能

摘要

少样本类增量学习(FSCIL)是一项具挑战性的持续学习任务,在多个学习阶段中仅提供有限的训练样本。要在此任务中取得成功,必须避免少样本训练集中有偏分布所导致的新类过拟合。解决该问题的通用方法是通过添加特殊模块以增强预定义骨干架构的表征能力,从而与旧类保持向后兼容。然而,该方法尚未解决在保证随时间高分类准确率的同时缩小大模型训练集与小训练集性能差距的困境。本工作中,我们提出一种名为持续参数高效 CLIP(CPE-CLIP)的替代方法,以减少不同学习阶段间的信息损失。我们并非适配额外模块以应对信息丢失,而是利用 CLIP 在大规模预训练中获取的广博知识及其泛化至新概念的有效性。我们的方法为多模态且参数高效,依赖于语言与视觉编码器的可学习 prompt 以实现跨阶段迁移学习。我们还引入 prompt 正则化以提升性能并防止遗忘。实验结果表明,与最先进方案相比,CPE-CLIP 显著提升了 FSCIL 性能,同时大幅减少了可学习参数数量与训练成本。

关键词

引用

@article{arxiv.2303.04751,
  title  = {Multimodal Parameter-Efficient Few-Shot Class Incremental Learning},
  author = {Marco D'Alessandro and Alberto Alonso and Enrique Calabrés and Mikel Galar},
  journal= {arXiv preprint arXiv:2303.04751},
  year   = {2024}
}