5%>100%:突破全微调在视觉识别任务上的性能束缚
计算机视觉与模式识别
2024-08-28 v2
摘要
预训练与微调可以提升视觉任务中的迁移效率和性能。近期的增量调优方法为视觉分类任务提供了更多选择。尽管取得了成功,现有的视觉增量调优方法在目标检测和分割等具有挑战性的任务上仍无法超越全微调的上限。为了找到全微调的有力替代方案,我们提出了多认知视觉适配器(Mona)调优,一种新颖的基于适配器的调优方法。首先,我们在适配器中引入多种视觉友好型滤波器以增强其处理视觉信号的能力,而此前的方法主要依赖语言友好型线性滤波器。其次,我们在适配器中添加了缩放归一化层,以调节视觉滤波器的输入特征分布。为了充分展示Mona的实用性和通用性,我们在多个代表性视觉任务上进行了实验,包括COCO上的实例分割、ADE20K上的语义分割、Pascal VOC上的目标检测、DOTA/STAR上的定向目标检测以及三个常用数据集上的图像分类。令人振奋的结果表明,Mona在所有这些任务上均超越了全微调,并且是唯一一种在上述各类任务上超越全微调的增量调优方法。例如,Mona在COCO数据集上相比全微调实现了1%的性能提升。综合结果表明,Mona调优比全微调更适合保留和利用预训练模型的能力。代码将发布于 https://github.com/Leiyi-Hu/mona。
引用
@article{arxiv.2408.08345,
title = {5%>100%: Breaking Performance Shackles of Full Fine-Tuning on Visual Recognition Tasks},
author = {Dongshuo Yin and Leiyi Hu and Bin Li and Youqun Zhang and Xue Yang},
journal= {arXiv preprint arXiv:2408.08345},
year = {2024}
}
备注
arXiv admin note: substantial text overlap with arXiv:2311.15010