用于文本视觉问答的结构化多模态注意力
计算机视觉与模式识别
2021-11-29 v2
摘要
本文中,我们提出一种端到端结构化多模态注意力(SMA)神经网络,主要解决上述前两个问题。SMA首先使用结构图表示来编码图像中出现的物体-物体、物体-文本和文本-文本关系,然后设计多模态图注意力网络对其进行推理。最后,上述模块的输出由全局-局部注意力作答模块处理,通过遵循M4C迭代地拼接来自OCR和通用词汇表的词元以产生答案。我们所提模型在TextVQA数据集及ST-VQA数据集的两个任务上优于所有SoTA模型,仅逊于基于预训练的TAP。展现出强大推理能力的同时,它还在TextVQA Challenge 2020中获得第一名。我们在多个推理模型上广泛测试不同OCR方法,并探究逐渐提升的OCR性能对TextVQA基准的影响。随着更好的OCR结果,不同模型在VQA准确率上均获得显著提升,但我们的模型因强大的文本-视觉推理能力受益最多。为给我们的方法设定上限并提供可供后续工作使用的公平测试基础,我们还提供了TextVQA数据集的人工标注真值OCR注释,原发布中并未给出。TextVQA数据集的代码与真值OCR注释可在 https://github.com/ChenyuGAO-CS/SMA 获取。
引用
@article{arxiv.2006.00753,
title = {Structured Multimodal Attentions for TextVQA},
author = {Chenyu Gao and Qi Zhu and Peng Wang and Hui Li and Yuliang Liu and Anton van den Hengel and Qi Wu},
journal= {arXiv preprint arXiv:2006.00753},
year = {2021}
}
备注
winner of TextVQA Challenge 2020, Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence