用于 TextVQA 的空间感知多模态 Transformer
计算机视觉与模式识别
2020-12-24 v2
摘要
文本线索对于购买食品和乘坐公共交通等日常任务至关重要。为开发这一辅助技术,我们研究 TextVQA 任务,即推理图像中的文本以回答问题。现有方法在空间关系的使用上有限,并依赖全连接的类 Transformer 架构来隐式学习场景的空间结构。相比之下,我们提出一种新颖的空间感知自注意力层,使得每个视觉实体仅关注由空间图定义的相邻实体。此外,我们多头自注意力层中的每个头聚焦于不同的关系子集。我们的方法有两个优势:(1) 每个头考虑局部上下文,而不是将注意力分散于所有视觉实体;(2) 我们避免学习冗余特征。我们表明,在改进的基线之上,我们的模型在 TextVQA 上将当前最先进方法的绝对准确率整体提升了 2.2%,在涉及空间推理且可利用 OCR tokens 正确回答的问题上提升了 4.62%。类似地,在 ST-VQA 上我们将绝对准确率提升了 4.2%。我们进一步表明,空间感知自注意力改善了视觉定位。
引用
@article{arxiv.2007.12146,
title = {Spatially Aware Multimodal Transformers for TextVQA},
author = {Yash Kant and Dhruv Batra and Peter Anderson and Alex Schwing and Devi Parikh and Jiasen Lu and Harsh Agrawal},
journal= {arXiv preprint arXiv:2007.12146},
year = {2020}
}
备注
Accepted at European Conference on Computer Vision, 2020