重新审视视觉提示调优:提示专家的表达力
机器学习
2026-02-12 v6 计算机视觉与模式识别
摘要
视觉提示调优(VPT)通过插入任务特定可学习提示标记,在参数高效地适应预训练视觉模型以应用于下游任务方面已被证明有效。尽管其实证成功已被证明,但对VPT的完整理论理解仍是活跃的研究领域。基于最近建立的混合专家(MoE)与基于提示的方法之间的联系——其中每个注意力头可概念化为多个MoE模型的组成——我们重新解释VPT,即将新的提示专家引入这些MoE结构。我们识别出现有VPT框架的一个关键局限性:提示专家的功能表达受限,这些专家保持静态,因此在适应性方面受到限制。为此,我们提出了视觉自适应提示调优(VAPT),一种新方法,赋予提示专家更大的表达力,同时保持参数效率。在VTAB-1K和FGVC上的经验评估表明,VAPT实现了显著的性能提升,分别超过了完全微调的基线方法7.34%和1.04%。此外,VAPT在要求更少额外参数的情况下始终优于VPT。 Furthermore,我们的理论分析表明,VAPT实现了最佳的样本效率。总体而言,这些结果凸显了我们方法的理论依据和实证优势。
引用
@article{arxiv.2501.18936,
title = {Revisit Visual Prompt Tuning: The Expressiveness of Prompt Experts},
author = {Minh Le and Anh Nguyen and Huy Nguyen and Chau Nguyen and Anh Tran and Nhat Ho},
journal= {arXiv preprint arXiv:2501.18936},
year = {2026}
}
备注
Accepted to ICLR 2026