FVG-PT:面向视觉语言模型的自适应前景视图引导式提示调优
计算机视觉与模式识别
2026-03-10 v1
摘要
CLIP 基于的提示调优使预训练视觉语言模型(VLM)能够高效地适应下游任务。尽管已有研究取得了显著进展,但它们关注不足:在调优过程中,VLMs 内部注意力表示的变化。本文将提示调优预测的 failure 模式归因于视觉编码器前景注意力的偏移,并提出前景视图引导式提示调优(FVG-PT),一个自适应即插即用前景注意力引导模块,以缓解此偏移。具体而言,FVG-PT 引入可自动提升前景视图质量的可学习的 Foreground Reliability Gate,应用 Foreground Distillation Compensation 模块引导视觉注意力聚焦前景,并进一步引入 Prior Calibration 模块以缓解因过度聚焦前景而导致的泛化退化。在多个 backbone 模型和数据集上的实验表明,FVG-PT 的有效性和兼容性。代码可在 https://github.com/JREion/FVG-PT 提供。
引用
@article{arxiv.2603.08708,
title = {FVG-PT: Adaptive Foreground View-Guided Prompt Tuning for Vision-Language Models},
author = {Haoyang Li and Liang Wang and Siyu Zhou and Jiacheng Sun and Jing Jiang and Chao Wang and Guodong Long and Yan Peng},
journal= {arXiv preprint arXiv:2603.08708},
year = {2026}
}
备注
27 Pages, 9 Figures, 15 Tables