LLM-wrapper:面向指代表达式理解的视觉语言模型黑盒语义感知适配
计算机视觉与模式识别
2025-03-07 v3
摘要
视觉语言模型 (VLM) 在各种开放词汇任务中已显示出惊人的能力,但其零-shot 性能仍落后于针对特定任务微调的模型,尤其是指代表达式理解 (REC) 等复杂任务。微调通常需要对模型的架构和权重进行 'white-box' 访问,这在面对专有或隐私问题时往往不可行。本文我们提出 LLM-wrapper,一种用于 REC 任务的 VLM 黑盒适配方法,利用大型语言模型 (LLM)。LLM-wrapper 利用 LLM 的推理能力,通过轻微微调来从由零-shot 黑盒 VLM 生成的候选框中选择最匹配指代表达式的框。我们方法的优势包括:能够在不了解其内部工作情况的情况下适配闭源模型、适用于任何 VLM、可迁移到新的 VLM 和数据集,以及可以对多个 VLM 的集成进行适配。我们使用不同的 VLM 和 LLM 在多个数据集上评估 LLM-wrapper,显示出显著的性能提升,凸显了我们方法的通用性。虽然 LLM-wrapper 不旨在直接与标准 white-box 微调竞争,但它为黑盒 VLM 适配提供了实用且有效的替代方案。代码和模型checkpoint可在 https://github.com/valeoai/LLM_wrapper 获取。
引用
@article{arxiv.2409.11919,
title = {LLM-wrapper: Black-Box Semantic-Aware Adaptation of Vision-Language Models for Referring Expression Comprehension},
author = {Amaia Cardiel and Eloi Zablocki and Elias Ramzi and Oriane Siméoni and Matthieu Cord},
journal= {arXiv preprint arXiv:2409.11919},
year = {2025}
}
备注
LLM-wrapper (v3) is published as a conference paper at ICLR 2025. (v1 was presented at EVAL-FoMo workshop, ECCV 2024.)