中文

通过KB-VQA中的问题分解解构基于知识的与视觉推理

人工智能 2024-06-28 v1

摘要

我们研究了知识基础视觉问答问题,该问题要求模型将其 grounding 到视觉模态以查找答案。虽然许多最近的工作使用question-dependent captioners来 verbalize 给定的图像并使用大语言模型来解决VQA问题,但研究结果显示它们在解决多跳问题时并 not reasonably performing。我们的研究表明,用几个更简单的问题替换复杂问题有助于从图像中提取更多相关信息并提供更强的理解。此外,我们分析分解后的问题以确定所需信息的模态,以 answer them,并为视觉问题使用captioner,为非视觉KB-based问题使用LLM作为通用知识来源。我们的结果表明,在使用简单问题检索视觉或非视觉信息之前,对准确性有积极影响。我们在三个著名的VQA数据集上提供了结果和分析,包括OKVQA、A-OKVQA和KRVQA,实现了最高可达2%的准确率提升。

关键词

引用

@article{arxiv.2406.18839,
  title  = {Disentangling Knowledge-based and Visual Reasoning by Question Decomposition in KB-VQA},
  author = {Elham J. Barezi and Parisa Kordjamshidi},
  journal= {arXiv preprint arXiv:2406.18839},
  year   = {2024}
}