中文

GLAD:面向视觉语言模型的通用调谐

计算机视觉与模式识别 2025-07-18 v1

摘要

预训练视觉语言模型,如 CLIP,显示出惊人的零样识别能力,可以通过 prompt tuning 轻松迁移到特定下游任务,即使在有限的训练数据下也能做到。然而,现有的 prompt tuning 方法面临两个主要挑战:(1)在 few-shot 场景中,数据稀缺常导致过拟合,使模型对输入域的变化敏感;(2)为缓解过拟合,这些方法通常依赖复杂的 task-specific 模型架构和敏感的超参数调优,严重限制了其通用性。为解决这些问题,我们提出一种更简单且更通用的框架,称为 GLAD(Generalizable LoRA tuning with RegulArized GraDient)。我们展示,仅应用 LoRA 即可在下游任务上实现相当于当前最先进 prompt-based 方法的性能。虽然 LoRA 有效且使用方便,但在 few-shot 学习场景中仍然容易受到过拟合。为缓解这一风险,我们引入一种基于梯度的正则化技术。这一技术有效引导优化轨迹,鼓励模型在更稳定且对数据分布变化具有鲁棒性的参数区域中寻找。通过在 15 个基准数据集上进行大量实验,我们展示 GLAD 在 base-to-novel 类别泛化、图像域泛化和 cross-dataset 泛化方面均优于以前的调谐方法。代码将公开提供。

关键词

引用

@article{arxiv.2507.13089,
  title  = {GLAD: Generalizable Tuning for Vision-Language Models},
  author = {Yuqi Peng and Pengfei Wang and Jianzhuang Liu and Shifeng Chen},
  journal= {arXiv preprint arXiv:2507.13089},
  year   = {2025}
}

备注

ICCV 2025 workshop