中文

参数高效少样本微调的强基线

计算机视觉与模式识别 2023-04-05 v1

摘要

少样本分类(FSC)指在基于一组基类的预训练(或元训练)阶段后,仅给定每类少量样本来学习新类。近期工作表明,简单地在测试新类上微调预训练的Vision Transformer (ViT)是一种用于FSC的有力方法。然而,ViT的微调在时间、计算和存储上代价高昂。这促使了参数高效微调(PEFT)方法的设计,其仅微调Transformer参数的一小部分。尽管这些方法已显示出前景,实验条件的不一致使得难以将其优势与其他实验因素(包括特征提取器架构、预训练初始化和微调算法等)区分开。在本文中,我们进行了大规模、实验一致的实证分析,以研究用于少样本图像分类的PEFT。通过在Meta-Dataset (MD)和ORBIT等大规模少样本基准上超过1.8k次受控实验,我们揭示了关于PEFT的新见解,阐明了其在少样本分类中微调ViT的有效性。通过受控实证研究,我们有两个主要发现:(i) 在少样本自适应过程中仅微调LayerNorm参数(我们称为LN-Tune)在自监督与有监督目标预训练的ViT上均是一个极强的基线;(ii) 对于自监督ViT,我们发现仅学习每组注意力矩阵的缩放参数(我们称为AttnScale)以及域残差适配器(DRA)模块,即可在MD上达到state-of-the-art性能(同时参数效率约高9倍)。我们广泛的实证发现确立了强基线,并呼吁重新思考当前FSC的PEFT方法设计。

关键词

引用

@article{arxiv.2304.01917,
  title  = {Strong Baselines for Parameter Efficient Few-Shot Fine-tuning},
  author = {Samyadeep Basu and Daniela Massiceti and Shell Xu Hu and Soheil Feizi},
  journal= {arXiv preprint arXiv:2304.01917},
  year   = {2023}
}