VladVA:面向判别式微调的 LVLMs
计算机视觉与模式识别
2025-05-12 v3 人工智能
摘要
对比学习训练的视觉语言模型(VLM),如 CLIP,已成为判别式视觉语言表征学习的事实标准方法。然而,这些模型语言理解能力有限,常表现出“词袋”行为。同时,结合视觉编码器与大语言模型(LLM)的大规模视觉语言模型(LVLM)已被证明能够进行细致的视觉语言推理,但其自回归特性使其在判别任务上不够适用。本文提出融合“两者优势”的新方法:为 LVLM 进行判别式微调,实现强大的判别能力与组合能力。具体而言,我们将生成式 LVLM 转换为判别式模型,解放其强大的图像-文本判别能力,同时增强语言理解。我们的贡献包括:(1)精心设计的训练/优化框架,利用可变长度和粒度的图像-文本对,结合对比损失和下一个标记预测损失进行训练,配套的消融实验证明了框架各组件的必要性;(2)基于软提示和 LoRA 适配器的参数高效适配方法;(3)在标准图像-文本检索基准测试和组合性任务上均实现显著提升,超越规模相似的 SOTA CLIP 类模型。
引用
@article{arxiv.2412.04378,
title = {VladVA: Discriminative Fine-tuning of LVLMs},
author = {Yassine Ouali and Adrian Bulat and Alexandros Xenos and Anestis Zaganidis and Ioannis Maniadis Metaxas and Brais Martinez and Georgios Tzimiropoulos},
journal= {arXiv preprint arXiv:2412.04378},
year = {2025}
}
备注
Published at CVPR 2025