多出口微调:面向视觉 Transformer 的高效推理适配
计算机视觉与模式识别
2024-09-24 v1
摘要
参数高效迁移学习(PETL)在将大规模数据集上预训练的视觉 Transformer(ViT)适配到各种下游任务中展现出了巨大潜力。现有研究主要集中在最小化可学习参数的数量。尽管这些方法在存储上很高效,但它们为简单样本分配了过多的计算资源,导致推理效率低下。为了解决这个问题,我们引入了一种称为多出口微调(MET)的高效推理微调方法。MET 将多个出口集成到预训练的 ViT 主干网络中。由于 ViT 中的预测由线性分类器完成,因此每个出口都配备了一个线性预测头。在推理阶段,简单样本将在早期出口退出,只有足够困难的样本才会流向最后一个出口,从而节省了简单样本的计算成本。MET 由特定于出口的适配器(E-adapter)和图正则化组成。E-adapter 旨在为不同的出口提取合适的表示。为了确保参数效率,所有 E-adapter 共享相同的下投影和上投影矩阵。由于线性分类器的性能受样本间关系的影响,我们采用图正则化来改善输入到早期出口分类器的表示。最后,我们进行了大量实验以验证 MET 的性能。实验结果表明,MET 在准确性和推理效率方面均明显优于现有最先进的方法。
引用
@article{arxiv.2409.13999,
title = {Multiple-Exit Tuning: Towards Inference-Efficient Adaptation for Vision Transformer},
author = {Zheng Liu and Jinchao Zhu and Nannan Li and Gao Huang},
journal= {arXiv preprint arXiv:2409.13999},
year = {2024}
}
备注
13 pages,13 figures,6 tables