面向密集视觉Transformer的选择性特征适配器
计算机视觉与模式识别
2023-10-04 v1
摘要
微调预训练的 transformer 模型(例如 Swin Transformer)在众多下游密集预测视觉任务中取得了成功。然而,一个主要问题是其海量参数带来的成本/存储,随着视觉任务数量的增长,这一问题变得越来越难以处理。在本文中,我们提出了一种缓解该问题的有效方法,称为选择性特征适配器(SFA)。它在任何给定的可训练参数预算下均达到最先进(SoTA)性能,并在各种密集任务中展现出与全微调模型相当或更好的性能。具体而言,SFA 由外部适配器和内部适配器组成,二者在 transformer 模型上顺序操作。对于外部适配器,我们恰当选择额外多层感知机(MLP)的位置与数量。对于内部适配器,我们转换 transformer 内部少数对任务重要的参数,这些参数通过简单而有效的彩票算法自动发现。我们的实验表明,双适配器模块(即 SFA)对于在分割、检测和深度估计等密集视觉任务上实现最佳权衡至关重要,优于具有单一模块的其他适配器。
引用
@article{arxiv.2310.01843,
title = {Selective Feature Adapter for Dense Vision Transformers},
author = {Xueqing Deng and Qi Fan and Xiaojie Jin and Linjie Yang and Peng Wang},
journal= {arXiv preprint arXiv:2310.01843},
year = {2023}
}