中文

一个质疑持续学习中预训练模型使用的简单基线

计算机视觉与模式识别 2023-03-30 v2 机器学习

摘要

随着预训练技术在表示学习中的成功,一系列基于预训练模型的持续学习方法被提出。其中一些方法在预训练表示上设计持续学习机制,并在持续学习训练过程中仅允许对骨干模型进行最小更新甚至不更新。在本文中,我们通过将这类方法与自行设计的一个简单基线进行比较,质疑这些模型的复杂性是否是取得良好性能所必需的。我们认为,在 Split-CIFAR100 和 CoRe 50 基准上,预训练特征提取器本身已足够强大,能够获得具有竞争力甚至更优的持续学习性能。为验证这一点,我们采用了一个非常简单的基线:1) 使用冻结的预训练模型为持续学习阶段遇到的每个类别提取图像特征,并在训练数据上计算其对应平均特征;2) 基于测试样本与各类别平均特征的最近邻距离预测输入类别,即最近均值分类器(Nearest Mean Classifier, NMC)。该基线是无任务头、无样本且可任务无关(通过持续更新均值)的。该基线在 10-Split-CIFAR-100 上取得了 88.53% 的准确率,超越了大多数同样使用相同预训练 transformer 模型初始化的当前最优持续学习方法。我们希望该基线能激励未来在设计学习系统方面的进展,使其即使从某些预训练权重起步,也能持续为学习表示增添质量。

关键词

引用

@article{arxiv.2210.04428,
  title  = {A Simple Baseline that Questions the Use of Pretrained-Models in Continual Learning},
  author = {Paul Janson and Wenxuan Zhang and Rahaf Aljundi and Mohamed Elhoseiny},
  journal= {arXiv preprint arXiv:2210.04428},
  year   = {2023}
}

备注

6 pages, Workshop on Distribution Shifts 2022 , Code available at https://github.com/Pauljanson002/pretrained-cl.git