视觉提示无关演化
计算机视觉与模式识别
2026-02-10 v2
摘要
视觉提示调谐(Visual Prompt Tuning, VPT)通过在每个层级的 token 序列中插入少量可学习提示 token 来适配冻结的 Vision Transformer(ViT)以适应下游任务。然而,我们发现现有 VPT 变体常因梯度振荡导致训练动力学不稳定。层级分析表明,浅层提示易早期停滞,而深层提示则表现出高方差振荡,造成跨层不匹配。这会显著减缓收敛并降低最终性能。为此,我们提出提示无关演化(Prompt-Agnostic Evolution, ),通过显式建模提示动力学加强视觉提示调谐。从频域视角, 通过揭示并传递背板天然利用的频率捷径模式,以任务相关方向初始化提示;采用共享 Koopman 算子施加全局线性变换,取代非协调的层级特定更新;受 Lyapunov 稳定性理论启发,引入正则项约束演化过程中的误差放大。广泛实验表明, 在 25 个数据集上实现平均 的加速收敛,并提升 1-3% 的精度。除性能外, 提示无关且轻量,可无需修改 backbone 或推理期间改变即可无缝集成至多种 VPT 变体。
引用
@article{arxiv.2601.20232,
title = {Visual Prompt-Agnostic Evolution},
author = {Junze Wang and Lei Fan and Dezheng Zhang and Weipeng Jing and Donglin Di and Yang Song and Sidong Liu and Cong Cong},
journal= {arXiv preprint arXiv:2601.20232},
year = {2026}
}
备注
Accepted by ICLR 2026