中文

重新审视语言先验在视觉-语言模型中的作用

计算机视觉与模式识别 2024-05-16 v4 人工智能 计算与语言

摘要

视觉-语言模型(VLMs)之所以有影响力,部分原因在于它们可以以零样本方式应用于各种视觉理解任务,无需任何微调。我们研究给定图像训练用于下一词生成的生成式 VLMs\textit{生成式 VLMs}。我们探索其在 8 个流行视觉-语言基准上图像-文本检索这一示例任务的零样本性能。我们的第一个观察是,它们可通过简单计算给定图像生成特定文本字符串的匹配分数,被重新用于判别任务(如图像-文本检索)。我们将这一概率分数称为视觉生成预训练分数\textit{视觉生成预训练分数}(VisualGPTScore)。虽然 VisualGPTScore 在某些检索基准上产生近乎完美的准确率,但在其他基准上准确率很差。我们通过概率视角分析该行为,指出某些基准通过创建对抗性但不可能的文本描述,无意中捕获了不自然的语言分布。事实上,我们证明即便忽略任何图像证据的“盲”语言模型有时也能超越所有先前最佳方法,令人想起多年前视觉问答(VQA)社区面临的类似挑战。我们推导出一种概率后处理方案,在测试时控制生成式 VLMs 中的语言偏置量,而无需重新训练或微调模型。我们展示适当去偏后的 VisualGPTScore 是视觉-语言理解的强零样本基线,经常产生最先进的准确率。

关键词

引用

@article{arxiv.2306.01879,
  title  = {Revisiting the Role of Language Priors in Vision-Language Models},
  author = {Zhiqiu Lin and Xinyue Chen and Deepak Pathak and Pengchuan Zhang and Deva Ramanan},
  journal= {arXiv preprint arXiv:2306.01879},
  year   = {2024}
}

备注

Published at ICML 2024. Website: https://linzhiqiu.github.io/papers/visual_gpt_score/