中文

小而强:用迷你适配器微调 ViTs

计算机视觉与模式识别 2023-11-08 v1 人工智能

摘要

Vision Transformers (ViTs) 已成为计算机视觉中占主导地位的架构之一,预训练的 ViT 模型通常通过微调适配新任务。近期工作提出了若干参数高效迁移学习方法,如适配器(adapter),以避免微调高昂的训练与存储成本。在本工作中,我们观察到当适配器维度较小时性能不佳,并提出了 MiMi,一个解决该问题的训练框架。我们从可达高性能的大适配器出发,迭代缩减其规模。为实现每个适配器隐藏维度的自动估计,我们还引入了一个新的评分函数,专为适配器设计,用于跨层比较神经元重要性。我们的方法在 DomainNet、VTAB 与 Multi-task 三个数据集基准(共 29 个数据集)上,于准确率与训练参数之间的最佳权衡方面优于现有方法。

关键词

引用

@article{arxiv.2311.03873,
  title  = {Mini but Mighty: Finetuning ViTs with Mini Adapters},
  author = {Imad Eddine Marouf and Enzo Tartaglione and Stéphane Lathuilière},
  journal= {arXiv preprint arXiv:2311.03873},
  year   = {2023}
}

备注

WACV2024