此去无方:视觉语言模型能否引导我们更好地回答问题?
计算机视觉与模式识别
2024-11-04 v1 人工智能
机器学习
摘要
在问答场景中,人类能够评估可用信息是否足够,若不足则寻求额外信息,而非直接给出强制答案。相比之下,视觉语言模型(VLMs)通常生成直接的单次响应,而不评估信息充分性。为探讨这一差距,我们识别了一个关键且具挑战性的任务:在视觉问答(VQA)情境中,VLMs能否指示如何调整图像以弥补信息不足以回答问题的能力?这一能力尤为重要,可帮助视障人士正确捕获图像。为评估当前VLMs的此项能力,我们引入了一个人工标注的数据集作为该任务的基准。此外,我们提出了一个自动化框架,通过模拟“在何处知道”情境生成合成训练数据。我们的实证结果显示,在使用合成数据微调后,主流VLMs的性能显著提升。这一研究表明,潜力在于缩小VLMs信息评估与获取之间的差距,使其性能更接近人类。
引用
@article{arxiv.2411.00394,
title = {Right this way: Can VLMs Guide Us to See More to Answer Questions?},
author = {Li Liu and Diji Yang and Sijia Zhong and Kalyana Suma Sree Tholeti and Lei Ding and Yi Zhang and Leilani H. Gilpin},
journal= {arXiv preprint arXiv:2411.00394},
year = {2024}
}
备注
NeurIPS 2024