中文

基于不确定性的视觉问答:估计图像与知识库之间的语义不一致性

计算机视觉与模式识别 2022-07-28 v1 人工智能 计算与语言 机器学习

摘要

基于知识的视觉问答(KVQA)任务旨在回答需要额外外部知识以及对图像与问题的理解的问题。近期关于KVQA的研究以多模态形式注入外部知识,但随着所用知识增多,可能引入无关信息并干扰问答。为合理使用知识,本研究提出:1)引入一种由描述不确定性(caption uncertainty)与语义相似度计算的新型语义不一致度量;2)提出一种基于该语义不一致度量的外部知识同化方法,并将其应用于KVQA中显式知识与隐式知识的融合;3)所提方法在OK-VQA数据集上评估,取得了最先进的性能。

关键词

引用

@article{arxiv.2207.13242,
  title  = {Uncertainty-based Visual Question Answering: Estimating Semantic Inconsistency between Image and Knowledge Base},
  author = {Jinyeong Chae and Jihie Kim},
  journal= {arXiv preprint arXiv:2207.13242},
  year   = {2022}
}

备注

Accepted by the 2022 International Joint Conference on Neural Networks (IJCNN 2022)