先定位后生成:以边界框桥接视觉与语言用于场景文本视觉问答
计算机视觉与模式识别
2023-04-05 v1 人工智能
摘要
本文提出一种用于场景文本视觉问答 (STVQA) 的新型多模态框架,该任务要求模型读取图像中的场景文本以回答问题。场景文本不同于可独立存在的文本或视觉对象,它通过传达语言语义同时作为图像中的视觉对象,自然地将文本与视觉模态联系在一起。与将场景文本中的语言语义与视觉语义作为两个独立特征的传统 STVQA 模型不同,本文提出“先定位后生成” (LTG) 范式,以空间边界框为桥梁显式统一这两种语义。具体而言,LTG 首先通过答案定位模块 (ALM) 定位图像中可能包含答案词的区域,该模块由区域提议网络与语言精炼网络组成,二者可通过场景文本边界框以一一映射相互转换。接着,给定 ALM 选出的答案词,LTG 基于预训练语言模型通过答案生成模块 (AGM) 生成可读的答案序列。得益于视觉与语言语义的显式对齐,即使无任何基于场景文本的预训练任务,LTG 在 TextVQA 数据集和 ST-VQA 数据集上分别相较无预训练基线提升了 +6.06% 和 +6.92% 的绝对准确率。我们进一步证明 LTG 通过空间边界框连接有效统一了视觉与文本模态,而这一点在以往方法中未被充分重视。
引用
@article{arxiv.2304.01603,
title = {Locate Then Generate: Bridging Vision and Language with Bounding Box for Scene-Text VQA},
author = {Yongxin Zhu and Zhen Liu and Yukang Liang and Xin Li and Hao Liu and Changcun Bao and Linli Xu},
journal= {arXiv preprint arXiv:2304.01603},
year = {2023}
}
备注
accepted in AAAI 2023