中文

视觉问答中基于相关问题与图像属性的知识检测

计算机视觉与模式识别 2024-09-01 v1 人工智能

摘要

视觉问答(VQA)是自然语言处理与计算机视觉交叉实践下的多学科研究问题。视觉问答依据图像内容自动回答自然语言问题。部分测试问题需要外部知识以推导答案。此类基于知识的VQA运用多种方法检索图像与文本特征,并融合以生成答案。为生成基于知识的答案,可采用依赖问题或依赖图像的知识检索方法。若推导出图像中所有对象的知识,则并非所有知识都与问题相关。另一方面,仅检索与问题相关的知识可能导致错误答案及过拟合模型,从而回答与图像无关的问题。我们提出的方法将图像属性与问题特征作为知识推导模块的输入,仅检索与问题相关的图像对象知识,从而提供准确答案。

关键词

引用

@article{arxiv.2306.04938,
  title  = {Knowledge Detection by Relevant Question and Image Attributes in Visual Question Answering},
  author = {Param Ahir and Hiteishi Diwanji},
  journal= {arXiv preprint arXiv:2306.04938},
  year   = {2024}
}