中文

定位、分组与选择:通过场景文本建模提升 Text-VQA 性能

计算机视觉与模式识别 2021-08-23 v1 计算与语言

摘要

作为多模态上下文理解中的一项重要任务,Text-VQA(视觉问答)旨在通过读取图像中的文本信息来回答问题。它与原始 VQA 任务的区别在于,Text-VQA 除了需要跨模态定位能力外,还需要大量的场景文本关系理解。在本文中,我们提出 Localize, Group, and Select(LOGOS),一种从多个方面尝试解决该问题的新模型。LOGOS 利用两个定位任务来更好地定位图像的关键信息,使用场景文本聚类对独立的 OCR(光学字符识别)标记进行分组,并学习从不同来源的 OCR 文本中选择最佳答案。实验表明,在不使用额外 OCR 标注数据的情况下,LOGOS 在两个 Text-VQA 基准上优于先前的最先进方法。消融研究和分析证明了 LOGOS 桥接不同模态和更好理解场景文本的能力。

关键词

引用

@article{arxiv.2108.08965,
  title  = {Localize, Group, and Select: Boosting Text-VQA by Scene Text Modeling},
  author = {Xiaopeng Lu and Zhen Fan and Yansen Wang and Jean Oh and Carolyn P. Rose},
  journal= {arXiv preprint arXiv:2108.08965},
  year   = {2021}
}

备注

9 pages