重述、增强、推理:视觉语言模型问题的视觉定位
计算与语言
2024-04-03 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
越来越多的视觉语言任务可以通过极少甚至无需训练(即零样本与少样本方式)来处理,其方法是将大语言模型(LLM)与视觉编码器结合,形成大型视觉语言模型(LVLM)。尽管这具有诸如无需训练数据或定制架构等巨大优势,但输入呈现给 LVLM 的方式会对零样本模型性能产生重大影响。特别是,以欠规范方式表述的输入,可能因缺失视觉信息、复杂的隐式推理或语言歧义等因素而导致错误答案。因此,在输入中作为预防性澄清添加视觉定位信息,应通过减少欠规范性来提升模型性能,例如通过定位物体和消歧指称。类似地,在 VQA 设定下,改变问题的表述方式可使其更易于模型回答。为此,我们提出重述、增强与推理(RepARe),一个无梯度框架,它利用底层 LVLM 作为描述生成器与推理器来提取关于图像的显著细节,从而对原始问题提出修改建议。随后,我们将 LVLM 对生成答案的置信度作为无监督评分函数,以选择最有可能提升零样本性能的改写问题。聚焦于三项视觉问答任务,我们表明 RepARe 在 VQAv2 上可实现零样本准确率 3.85%(绝对)提升,在 A-OKVQA 与 VizWiz 上分别实现 6.41% 与 7.94% 点的提升。此外,我们发现使用标准答案进行神谕式问题候选选择可在 VQA 准确率上获得高达 14.41% 的显著提升。通过广泛分析,我们证明 RepARe 的输出增加了句法复杂性,并有效利用了视觉语言交互与冻结的 LLM。
引用
@article{arxiv.2310.05861,
title = {Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models},
author = {Archiki Prasad and Elias Stengel-Eskin and Mohit Bansal},
journal= {arXiv preprint arXiv:2310.05861},
year = {2024}
}
备注
ICLR 2024 camera-ready (23 pages), Code: https://github.com/archiki/RepARe