SceneGATE:基于场景图协同注意力网络的文本视觉问答
计算机视觉与模式识别
2023-08-08 v3 计算与语言
摘要
大多数 TextVQA 方法聚焦于通过简单 transformer 编码器整合对象、场景文本与问题词,但这未能捕获不同模态之间的语义关系。本文提出一种用于 TextVQA 的基于场景图的协同注意力网络(SceneGATE),其揭示了对象、光学字符识别(OCR)词元与问题词之间的语义关系。这是通过基于 TextVQA 的场景图实现的,该场景图发掘图像底层语义。我们创建了引导注意力模块以捕获语言与视觉之间的模态内交互,作为模态间交互的引导。为显式地教导两模态间关系,我们提出并集成两个注意力模块,即基于场景图的语义关系感知注意力与位置关系感知注意力。我们在两个基准数据集 Text-VQA 与 ST-VQA 上进行了大量实验。结果表明,由于场景图及其注意力模块,我们的 SceneGATE 方法优于现有方法。
引用
@article{arxiv.2212.08283,
title = {SceneGATE: Scene-Graph based co-Attention networks for TExt visual question answering},
author = {Feiqi Cao and Siwen Luo and Felipe Nunez and Zean Wen and Josiah Poon and Caren Han},
journal= {arXiv preprint arXiv:2212.08283},
year = {2023}
}
备注
Published in Robotics (Q1, SCI indexed Journal): https://www.mdpi.com/2218-6581/12/4/114