中文

利用预训练视觉 Transformer 校准高阶统计量以实现少样本类增量学习

计算机视觉与模式识别 2024-04-11 v1

摘要

少样本类增量学习(FSCIL)旨在使模型从极少数据(5 个样本)中适应新类,同时不遗忘已学过的类。多样本 CIL(MSCIL)(使用所有可用训练数据)的近期工作利用预训练模型来减少遗忘并实现更好的可塑性。类似地,我们将在大规模数据集上预训练的 ViT 模型用于少样本设置,该设置面临可塑性低的关键问题。FSCIL 方法以一个多样本的首个任务开始,以学习一个非常好的特征提取器,然后从第二个任务起转向少样本设置。尽管近期大多数研究的重点是如何学习多样本的首个任务以使模型泛化到所有未来的少样本任务,但我们在本工作中探索了如何利用预训练模型更好地对少样本数据进行建模,而不论首个任务如何训练。受 MSCIL 近期工作的启发,我们探索了利用高阶特征统计量如何影响少样本类的分类。我们识别出从少样本数据中获取良好协方差矩阵的主要挑战,并提出基于与多样本基类的语义相似性来校准新类的协方差矩阵。将校准后的特征统计量与现有方法相结合,在多个 FSCIL 基准上显著提升了少样本持续分类性能。代码可在 https://github.com/dipamgoswami/FSCIL-Calibration 获取。

关键词

引用

@article{arxiv.2404.06622,
  title  = {Calibrating Higher-Order Statistics for Few-Shot Class-Incremental Learning with Pre-trained Vision Transformers},
  author = {Dipam Goswami and Bartłomiej Twardowski and Joost van de Weijer},
  journal= {arXiv preprint arXiv:2404.06622},
  year   = {2024}
}

备注

Accepted at CLVision workshop (CVPR 2024)