中文

Consolidator:具有分组连接的可合并适配器用于视觉自适应

计算机视觉与模式识别 2023-05-02 v1 人工智能 机器学习

摘要

近年来,Transformer 作为视觉特征提取器展现出强大的能力,在各种场景下超越了传统的基于卷积的模型。然而,视觉 Transformer 的成功很大程度上归功于其容纳大量参数的能力。因此,将大型模型适配到下游任务时出现了新的挑战。一方面,经典微调为每个任务调整巨大模型中的所有参数,因此容易陷入过拟合,导致性能不佳。另一方面,在资源受限的设备上,微调会存储一份完整的参数副本,因而通常因存储空间不足而不可行。然而,很少有工作关注如何高效且有效地在视觉 Transformer 中迁移知识。现有方法未深入探究视觉特征的特性,导致性能不佳。此外,其中一些方法虽有益于存储,却带来了沉重的推理开销。为解决这些问题,我们提出 consolidator,通过添加一小部分可调节参数来修改预训练模型,在冻结主干模型的同时临时存储任务特定知识。受分组卷积成功的启发,我们在全连接层提取的特征之间采用分组连接来构建 consolidator 中的可调节部分。为了在受限存储预算下进一步增强模型的知识迁移能力并保持推理高效,我们以两个阶段整合参数:1. 在适配与存储之间,以及 2. 在加载与推理之间。在一系列下游视觉任务上,我们的 consolidator 仅用 0.35% 的参数即可达到比全微调高至多 7.56 的准确率,并以明显优势超越最先进的参数高效微调方法。代码见 https://github.com/beyondhtx/Consolidator。

关键词

引用

@article{arxiv.2305.00603,
  title  = {Consolidator: Mergeable Adapter with Grouped Connections for Visual Adaptation},
  author = {Tianxiang Hao and Hui Chen and Yuchen Guo and Guiguang Ding},
  journal= {arXiv preprint arXiv:2305.00603},
  year   = {2023}
}

备注

ICLR 2023