中文

SA$^2$VP:空间对齐与自适应视觉提示

计算机视觉与模式识别 2023-12-19 v1

摘要

作为 NLP 中一种突出的参数高效微调技术,提示调优正在探索其在计算机视觉中的潜力。典型的视觉提示调优方法遵循源于 NLP 的序列建模范式,即将输入图像表示为扁平化的 token 嵌入序列,然后学习一组无序的参数化 token 前置于该序列表示,作为大型视觉模型任务适配的视觉提示。尽管这种视觉提示的序列建模范式展现出了巨大潜力,但仍存在两个潜在局限性。首先,学习到的视觉提示无法建模输入图像中潜在的空间关系,而这对于图像编码至关重要。其次,由于所有提示 token 对所有图像 token 起到不加区分的相同提示作用,它缺乏细粒度的提示能力,即对不同图像 token 的单独提示。在本工作中,我们提出了 \mymodel 模型 (\emph{SA2^2VP}),该模型学习一个与图像 token 映射尺寸相等(或成比例缩放)的二维提示 token 映射,从而能够与图像映射进行空间对齐。每个提示 token 被指定仅对空间上对应的图像 token 提示知识。因此,我们的模型能够以细粒度的方式对不同的图像 token 进行单独提示。此外,得益于学习到的提示 token 映射保留空间结构的能力,我们的 \emph{SA2^2VP} 能够建模输入图像中的空间关系,从而实现更有效的提示。在三个具有挑战性的图像分类基准上的大量实验证明了我们的模型相对于其他用于视觉提示调优的最先进方法的优越性。代码可在 \emph{https://github.com/tommy-xq/SA2VP} 获取。

关键词

引用

@article{arxiv.2312.10376,
  title  = {SA$^2$VP: Spatially Aligned-and-Adapted Visual Prompt},
  author = {Wenjie Pei and Tongqi Xia and Fanglin Chen and Jinsong Li and Jiandong Tian and Guangming Lu},
  journal= {arXiv preprint arXiv:2312.10376},
  year   = {2023}
}

备注

Accepted by AAAI 2024