中文

面向视觉问答的问题驱动图融合网络

计算机视觉与模式识别 2022-04-05 v1 计算与语言

摘要

现有视觉问答(VQA)模型已探索图像中物体间的各种视觉关系以回答复杂问题,这不可避免地引入了由不准确的物体检测与文本定位带来的无关信息。为解决该问题,我们提出一种问题驱动图融合网络(QD-GFN)。它首先通过三个图注意力网络对图像中的语义、空间与隐式视觉关系建模,然后利用问题信息引导三个图的聚合过程,进而我们的 QD-GFN 采用物体过滤机制去除图像中与问题无关的物体。实验结果表明,我们的 QD-GFN 在 VQA 2.0 与 VQA-CP v2 数据集上均优于先前最先进方法。进一步分析显示,新颖的图聚合方法与物体过滤机制均对提升模型性能起到重要作用。

关键词

引用

@article{arxiv.2204.00975,
  title  = {Question-Driven Graph Fusion Network For Visual Question Answering},
  author = {Yuxi Qian and Yuncong Hu and Ruonan Wang and Fangxiang Feng and Xiaojie Wang},
  journal= {arXiv preprint arXiv:2204.00975},
  year   = {2022}
}

备注

Accepted by ICME 2022