中文

原始数据决定性:基于内部增强提升视觉语言模型的提示调优

计算机视觉与模式识别 2025-11-13 v2

摘要

对于基于 CLIP 的提示调优,引入更多数据作为增强微调过程的额外知识已被证明是有效的方法。现有提示调优的数据放大策略通常依赖于外部知识(如大型语言模型或预结构化知识库),导致数据收集和处理成本更高,同时通常忽略了图像模态特征的进一步利用。为此,我们提出了基于增强驱动的提示调优 (AugPT),这是一种仅使用内部增强的自包含蒸馏式提示调优方法,以更好地利用已知特征。具体而言,AugPT 在未标记图像上的训练集上应用自监督增强,并引入基于共识测试的新型门控机制,重用预训练的提示调优 backbone 模型,以自发方式筛选噪声样本,进一步提高增强视图的质量。广泛的实验验证了 AugPT 在不使用追加外部知识的情况下,同时提升了模型性能和泛化能力。AugPT 的代码可获得:https://github.com/JREion/AugPT。

关键词

引用

@article{arxiv.2508.02671,
  title  = {Raw Data Matters: Enhancing Prompt Tuning by Internal Augmentation on Vision-Language Models},
  author = {Haoyang Li and Liang Wang and Chao Wang and Siyu Zhou and Jing Jiang and Yan Peng and Guodong Long},
  journal= {arXiv preprint arXiv:2508.02671},
  year   = {2025}
}

备注

16 pages, 6 figures, 15 tables