填补 VQA 的图像信息鸿沟:提示大语言模型主动提问
计算与语言
2024-06-11 v1
摘要
大语言模型(LLM)不仅在自然语言任务中,而且在一些视觉-语言任务(如开放域基于知识的视觉问答(OK-VQA))中,都展现出令人印象深刻的推理能力以及对世界知识的保持。由于图像对 LLM 不可见,研究者将图像转换为文本以让 LLM 参与视觉问答推理过程。这导致呈现给 LLM 的图像与其文本表示之间存在差异,从而阻碍了最终的推理性能。为填补信息鸿沟并更好地利用推理能力,我们设计了一个框架,使 LLM 能够主动提出相关问题以揭示图像中更多细节,并配有用于精炼生成信息的过滤器。我们在 OK-VQA 和 A-OKVQA 上验证了我们的想法。我们的方法在 OK-VQA 上持续以平均 2.15% 的增益提升基线方法的性能,并在不同 LLM 上取得一致改进。
引用
@article{arxiv.2311.11598,
title = {Filling the Image Information Gap for VQA: Prompting Large Language Models to Proactively Ask Questions},
author = {Ziyue Wang and Chi Chen and Peng Li and Yang Liu},
journal= {arXiv preprint arXiv:2311.11598},
year = {2024}
}
备注
Accepted to EMNLP2023 Findings