用于视觉与场景文本联合推理的多模态图神经网络
计算机视觉与模式识别
2020-04-01 v1
摘要
回答需要读取图像中文字的问题对当前模型而言具有挑战性。该任务的一个关键困难是罕见、多义及歧义词频繁出现于图像中,例如地名、产品和运动队名。为克服此困难,仅借助预训练词嵌入模型远不充分。一个理想的模型应利用图像多模态中的丰富信息以帮助理解场景文本含义,例如瓶身上醒目文字极可能为品牌名。遵循该思路,我们提出一种新颖的 VQA 方法——多模态图神经网络(MM-GNN)。它首先将图像表示为由三个子图构成的图,分别刻画视觉、语义与数值模态。随后,我们引入三个聚合器引导消息从一个图传递到另一图,以利用各模态中的上下文,从而精炼节点特征。更新后的节点具备更优特征供下游问答模块使用。实验评估表明,我们的 MM-GNN 能更好地表征场景文本,并明显提升两个需读取场景文本的 VQA 任务性能。
引用
@article{arxiv.2003.13962,
title = {Multi-Modal Graph Neural Network for Joint Reasoning on Vision and Scene Text},
author = {Difei Gao and Ke Li and Ruiping Wang and Shiguang Shan and Xilin Chen},
journal= {arXiv preprint arXiv:2003.13962},
year = {2020}
}
备注
Published as a CVPR2020 paper