用于视觉问答的由粗到细推理
计算机视觉与模式识别
2022-04-20 v2
摘要
弥合图像与问题之间的语义鸿沟是提高视觉问答(VQA)任务准确率的重要步骤。然而,现有多数VQA方法聚焦于注意力机制或视觉关系来推理答案,而未充分利用不同语义层级的特征。本文提出一种新的推理框架,以填补VQA任务中视觉特征与语义线索之间的鸿沟。我们的方法首先从图像和问题中提取特征与谓词。随后提出一种新的推理框架,以由粗到细的方式有效联合学习这些特征与谓词。在三个大规模VQA数据集上的密集实验结果表明,与其他最先进(SOTA)方法相比,我们所提方法取得了更优的准确率。此外,我们的推理框架还提供了一种可解释的途径,以理解深度神经网络在预测答案时的决策过程。
引用
@article{arxiv.2110.02526,
title = {Coarse-to-Fine Reasoning for Visual Question Answering},
author = {Binh X. Nguyen and Tuong Do and Huy Tran and Erman Tjiputra and Quang D. Tran and Anh Nguyen},
journal= {arXiv preprint arXiv:2110.02526},
year = {2022}
}
备注
Accepted in CVPR 2022 Workshops