中文

RUArt:一种以文本为中心的基于文本的视觉问答解决方案

计算机视觉与模式识别 2020-10-27 v1 人工智能

摘要

基于文本的视觉问答(VQA)需要读取并理解图像中的文本以正确回答给定问题。然而,当前大多数方法只是将图像中提取的光学字符识别(OCR)标记简单加入 VQA 模型,而未考虑 OCR 标记的上下文信息以及挖掘 OCR 标记与场景对象之间的关系。本文提出一种名为 RUArt(阅读、理解并回答相关文本)的以文本为中心的新方法用于基于文本的 VQA。RUArt 以图像和问题作为输入,首先读取图像并获取文本和场景对象。然后,它在场景上下文中理解问题、OCR 文本和对象,并进一步挖掘它们之间的关联。最后,它通过文本语义匹配与推理回答给定问题的相关文本。我们在两个基于文本的 VQA 基准(ST-VQA 和 TextVQA)上评估了 RUArt,并进行了大量消融实验以探究其有效性背后的原因。实验结果表明,我们的方法能有效利用文本的上下文信息并挖掘文本与对象间的稳定关系。

关键词

引用

@article{arxiv.2010.12917,
  title  = {RUArt: A Novel Text-Centered Solution for Text-Based Visual Question Answering},
  author = {Zan-Xia Jin and Heran Wu and Chun Yang and Fang Zhou and Jingyan Qin and Lei Xiao and Xu-Cheng Yin},
  journal= {arXiv preprint arXiv:2010.12917},
  year   = {2020}
}