中文

视觉提示无关演化

计算机视觉与模式识别 2026-02-10 v2

摘要

视觉提示调谐(Visual Prompt Tuning, VPT)通过在每个层级的 token 序列中插入少量可学习提示 token 来适配冻结的 Vision Transformer(ViT)以适应下游任务。然而,我们发现现有 VPT 变体常因梯度振荡导致训练动力学不稳定。层级分析表明,浅层提示易早期停滞,而深层提示则表现出高方差振荡,造成跨层不匹配。这会显著减缓收敛并降低最终性能。为此,我们提出提示无关演化(Prompt-Agnostic Evolution, PAE\mathtt{PAE}),通过显式建模提示动力学加强视觉提示调谐。从频域视角,PAE\mathtt{PAE} 通过揭示并传递背板天然利用的频率捷径模式,以任务相关方向初始化提示;采用共享 Koopman 算子施加全局线性变换,取代非协调的层级特定更新;受 Lyapunov 稳定性理论启发,引入正则项约束演化过程中的误差放大。广泛实验表明,PAE\mathtt{PAE} 在 25 个数据集上实现平均 1.41×1.41\times 的加速收敛,并提升 1-3% 的精度。除性能外,PAE\mathtt{PAE} 提示无关且轻量,可无需修改 backbone 或推理期间改变即可无缝集成至多种 VPT 变体。

关键词

引用

@article{arxiv.2601.20232,
  title  = {Visual Prompt-Agnostic Evolution},
  author = {Junze Wang and Lei Fan and Dezheng Zhang and Weipeng Jing and Donglin Di and Yang Song and Sidong Liu and Cong Cong},
  journal= {arXiv preprint arXiv:2601.20232},
  year   = {2026}
}

备注

Accepted by ICLR 2026