面向少样本持续学习的视觉 Transformer 自适应加法参数更新
计算机视觉与模式识别
2025-05-06 v2
摘要
在人工智能领域,持续集成新类信息而不丢失先前获取的知识仍是核心挑战,常称为“灾难性遗忘”。少样本类别增量学习(FSCIL)通过首先在基本类的稳健数据集上训练模型,然后在后续会话中仅使用每个新类的少量标记样本来逐步适应模型来应对这一问题。然而,这种方法容易对有限的新数据过拟合,从而可能影响整体性能并加剧遗忘。在本工作中,我们提出了一种简单而有效的新型 FSCIL 框架,利用冻结的视觉 Transformer(ViT) 主干架构增添参数高效的加法更新。我们的做法冻结预训练的 ViT 参数,并通过加法更新机制将可训练权重有选择地注入自注意力模块中。这种设计仅更新少量参数以适应新类别,同时不牺牲在 base session 期间学习的表征。通过对有限数量的参数进行微调,我们的方法保留了冻结 ViT 中的通用特征,同时降低了过拟合风险。此外,由于大多数参数保持固定,当引入小批量新数据时,模型可避免覆盖先前学习的知识。广泛的实验表明,我们的方法在基准数据集上实现了对比 FSCIL 基线方法的领先性能。
引用
@article{arxiv.2504.08982,
title = {Adaptive Additive Parameter Updates of Vision Transformers for Few-Shot Continual Learning},
author = {Kyle Stein and Andrew Arash Mahyari and Guillermo Francia and Eman El-Sheikh},
journal= {arXiv preprint arXiv:2504.08982},
year = {2025}
}