面向多模态 LLM 零样本视觉问答中微小视觉细节感知的研究
计算机视觉与模式识别
2024-02-13 v3 计算与语言
摘要
多模态大语言模型(MLLM)近期在视觉问答(VQA)——一项影响各类下游应用与领域的基础任务——上取得了有前景的零样本准确率。鉴于这些模型广泛使用的巨大潜力,考察它们在处理不同图像与问题属性时的局限性十分重要。本工作中,我们研究 MLLM 能否像感知图像中大型细节一样感知小型细节。具体而言,我们展示它们回答视觉问题的零样本准确率对问题所涉视觉主体尺寸极为敏感,随尺寸下降可达 46%。此外,我们通过观察人类视觉裁剪能显著缓解其对尺寸的敏感性,表明该效应具有因果性。受人类裁剪有效性的启发,我们进而提出五种自动视觉裁剪方法——利用外部定位模型或给定 MLLM 自身的决策过程——作为推理时机制以提升 MLLM 的零样本性能。我们在四个流行 VQA 数据集及为精细视觉细节定制的 VQAv2 子集上研究了其有效性。我们的发现表明,MLLM 应在细节敏感型 VQA 应用中谨慎使用,且视觉裁剪是提升其零样本性能的有前景方向。为促进对 MLLM 行为的进一步研究,我们的代码与数据已公开发布。
引用
@article{arxiv.2310.16033,
title = {Towards Perceiving Small Visual Details in Zero-shot Visual Question Answering with Multimodal LLMs},
author = {Jiarui Zhang and Mahyar Khayatkhoei and Prateek Chhikara and Filip Ilievski},
journal= {arXiv preprint arXiv:2310.16033},
year = {2024}
}
备注
20 pages, 12 figures, 7 tables