中文

通过大语言模型的QA链将视觉问答从合成问题泛化到人类编写问题

计算与语言 2024-08-23 v3 计算机视觉与模式识别

摘要

视觉问答(VQA)是一项给定图像并针对图像提出一系列问题的任务。为了构建高效的VQA算法,需要大量非常昂贵的QA数据。基于模板生成合成QA对是获取数据的一种实用方法。然而,在这些数据上训练的VQA模型在复杂的人类编写问题上表现不佳。为了解决这个问题,我们提出了一种新方法,称为人类编写问题的QA链(CoQAH)。CoQAH利用大语言模型和基于合成数据训练的VQA模型之间的QA交互序列来推理并得出人类编写问题的逻辑答案。我们在两种类型的人类编写VQA数据集(针对3D渲染图像和胸部X光图像)上测试了CoQAH的有效性,发现它在两种数据类型上都达到了最先进的准确率。值得注意的是,CoQAH在没有微调的情况下优于通用的视觉-语言模型、VQA模型和医学基础模型。

关键词

引用

@article{arxiv.2401.06400,
  title  = {Generalizing Visual Question Answering from Synthetic to Human-Written Questions via a Chain of QA with a Large Language Model},
  author = {Taehee Kim and Yeongjae Cho and Heejun Shin and Yohan Jo and Dongmyung Shin},
  journal= {arXiv preprint arXiv:2401.06400},
  year   = {2024}
}