中文

LaTr:面向场景文本视觉问答的布局感知 Transformer

计算机视觉与模式识别 2021-12-28 v2

摘要

我们提出一种用于场景文本视觉问答(STVQA)的新型多模态架构,名为布局感知 Transformer(LaTr)。STVQA 任务要求模型对不同的模态进行推理。因此,我们首先考察各模态的影响,并揭示了语言模块的重要性,尤其在融入布局信息时。鉴于此,我们提出一种仅需文本与空间线索的单目标预训练方案。我们表明,尽管存在域间隙,在扫描文档上应用此预训练方案相较于使用自然图像具有一定优势。扫描文档易于获取、文本密集且具多种布局,通过将语言与布局信息绑定,帮助模型学习各种空间线索(例如左邻、下方等)。与现有方法相比,我们的方法执行无词汇表解码,并且如所示,能很好地泛化至训练词汇之外。我们进一步证明 LaTr 提升了对 OCR 错误的鲁棒性,而后者是 STVQA 中失败案例的常见原因。此外,通过利用视觉 transformer,我们消除了对外部目标检测器的需求。LaTr 在多个数据集上优于最先进的 STVQA 方法。具体而言,在 TextVQA 上 +7.6%、在 ST-VQA 上 +10.8%、在 OCR-VQA 上 +4.0%(均为绝对准确率数值)。

关键词

引用

@article{arxiv.2112.12494,
  title  = {LaTr: Layout-Aware Transformer for Scene-Text VQA},
  author = {Ali Furkan Biten and Ron Litman and Yusheng Xie and Srikar Appalaraju and R. Manmatha},
  journal= {arXiv preprint arXiv:2112.12494},
  year   = {2021}
}