中文

VIPAMIN:基于嵌入选择和子空间扩展的视觉提示初始化

计算机视觉与模式识别 2025-10-21 v1 机器学习

摘要

在大规模基础模型时代,为每个下游任务全部分支预训练网络往往资源消耗巨大。提示调谗通过保持主干网络冻结而引入可调提示,提供了一种轻量级替代方案。然而,现有的视觉提示调谉方法往往难以为提示专业化或丰富表征空间——尤其是应用于自监督主干网络时。我们指出,在具有挑战性的任务和数据稀缺的设置中,这些局限性尤为突出,在这种情况下有效的适应性最为关键。本文介绍了VIPAMIN(Visual Prompt Initialization via Embedding Selection and Subspace Expansion),一种提升自监督模型适应性的视觉提示初始化策略,通过 (1) 将提示与嵌入空间中语义丰富区域对齐,以及 (2) 注入预训练子空间之外的新表征方向。尽管方法简单——仅需一次前向传播和轻量级操作——VIPAMIN 在 diverse 任务和数据集大小上均一致提升性能,在视觉提示调谉领域取得了新的最佳结果。我们的代码已公开:https://github.com/iamjaekyun/vipamin。

关键词

引用

@article{arxiv.2510.16446,
  title  = {VIPAMIN: Visual Prompt Initialization via Embedding Selection and Subspace Expansion},
  author = {Jaekyun Park and Hye Won Chung},
  journal= {arXiv preprint arXiv:2510.16446},
  year   = {2025}
}

备注

NeurIPS 2025