中文

LION:隐式视觉提示微调

计算机视觉与模式识别 2024-03-28 v3

摘要

尽管视觉Transformer在一系列视觉任务上近期取得了具有竞争力的性能,但其仍存在计算成本过高的难题。近来,视觉提示学习为在不微调整个大规模模型的前提下解决该问题提供了一种经济方案。然而,由于插入了大量提示块并采用繁琐的提示设计,现有模型的效率仍远不能令人满意。本文受具有稳定内存成本以应对各类复杂任务的深度隐式模型启发,提出了一种高效的视觉模型,称为隐式视觉提示微调(impLicit vIsion prOmpt tuNing, LION)。具体而言,我们在冻结主干参数的预训练主干网络两端仅插入两个平衡隐式层。此外,我们根据彩票假设对这两层中的参数进行剪枝。我们的LION在广泛的数据集上取得了令人满意的性能。特别地,与最先进的基线VPT相比,我们的LION在训练参数数量上最多减少11.5%,同时获得更高性能,尤其在具有挑战性的场景下。此外,我们发现所提出的LION具有良好的泛化性能,使其成为未来提升迁移学习的一种简便途径。

关键词

引用

@article{arxiv.2303.09992,
  title  = {LION: Implicit Vision Prompt Tuning},
  author = {Haixin Wang and Jianlong Chang and Xiao Luo and Jinan Sun and Zhouchen Lin and Qi Tian},
  journal= {arXiv preprint arXiv:2303.09992},
  year   = {2024}
}

备注

Accepted by AAAI2024; 9 pages, 3 figures, 4 tables