LSPT:用于视觉表示学习的长期空间提示微调
计算机视觉与模式识别
2024-02-28 v1 人工智能
机器学习
摘要
视觉提示微调 (VPT) 技术因其能够利用称为提示的可学习专用令牌,将预训练的 Vision Transformers (ViTs) 适配到下游视觉任务而备受关注。当代 VPT 方法,尤其是在与自监督视觉 Transformer 结合使用时,往往默认引入新的可学习提示或主要源自模型前一块的门控提示令牌。此类方法的一个关键疏忽是未能利用每个自监督 ViT 中长距离前序块作为提示源的潜力。为了弥补这一关键差距,我们引入了长期空间提示微调 (LSPT)——一种视觉表示学习的革命性方法。受人类大脑复杂性的启发,LSPT 巧妙地融入了长期门控提示。该特征作为时间编码,抑制了遗忘从前序块获得的参数的风险。为进一步增强其能力,LSPT 引入了补丁令牌作为空间编码。这一设计旨在持续积累类意识特征,从而增强模型区分和识别视觉类别的能力。为了验证我们提出方法的有效性,我们在 5 个 FGVC 和 19 个 VTAB-1K 基准上进行了严格的实验。我们的实证结果强调了 LSPT 的优越性,展示了其在视觉提示微调性能方面树立新基准的能力。
引用
@article{arxiv.2402.17406,
title = {LSPT: Long-term Spatial Prompt Tuning for Visual Representation Learning},
author = {Shentong Mo and Yansen Wang and Xufang Luo and Dongsheng Li},
journal= {arXiv preprint arXiv:2402.17406},
year = {2024}
}