中文

一种面向基于知识的视觉问答的统一端到端检索-阅读框架

计算机视觉与模式识别 2022-07-01 v1

摘要

基于知识的视觉问答(VQA)期望模型依赖外部知识进行鲁棒的答案预测。尽管至关重要,本文发现了阻碍当前最优方法进展的几个主导因素。一方面,利用显式知识的方法将知识作为粗粒度训练的 VQA 模型的补充。尽管有效,这些方法常受噪声引入与错误传播之苦。另一方面,关于隐式知识,面向基于知识的 VQA 的多模态隐式知识仍大抵未被探索。本工作提出一种面向基于知识的 VQA 的统一端到端检索-阅读框架。具体而言,我们借助视觉-语言预训练模型中的多模态隐式知识,挖掘其在知识推理中的潜力。针对显式知识检索操作所遇噪声问题,我们设计了一种新颖方案来创建伪标签以实现有效的知识监督。该方案不仅能为指导知识检索提供依据,还可剔除那些对问答而言潜在易错的样本。为验证所提方法的有效性,我们在基准数据集上进行了大量实验。实验结果表明,我们的方法以显著优势超越现有基线。除报告数值外,本文还借助若干经验发现,进一步催生了关于未来研究中知识利用的几点见解。

关键词

引用

@article{arxiv.2206.14989,
  title  = {A Unified End-to-End Retriever-Reader Framework for Knowledge-based VQA},
  author = {Yangyang Guo and Liqiang Nie and Yongkang Wong and Yibing Liu and Zhiyong Cheng and Mohan Kankanhalli},
  journal= {arXiv preprint arXiv:2206.14989},
  year   = {2022}
}