中文

基于引导注意的大规模场景文本验证

计算机视觉与模式识别 2018-11-20 v2

摘要

许多任务都涉及判定特定文本串是否存在于图像中。本工作中,我们提出一种以端到端方式学习该任务的新框架。该框架以图像和文本串为输入,输出文本串出现在图像中的概率。这是首个在场景文本领域端到端学习文本与图像间此类关系的框架。该框架不需要显式的场景文本检测或识别,因此无需边界框标注。它也是场景文本领域首个处理此类弱标注问题的工作。基于此框架,我们开发了名为 Guided Attention 的模型。我们设计的模型在一项具有挑战性的街景商户匹配任务上,比若干基于 SOTA 场景文本读取的方案取得好得多的结果。该任务试图为店面图像寻找正确的商户名称,我们为其收集的数据集比现有场景文本数据集规模更大且更具挑战性。这一新的真实世界任务为研究场景文本相关问题提供了新视角。我们还通过对比本问题与典型的视觉问答(Visual Question Answering)问题,展示了我们任务的独特性。

关键词

引用

@article{arxiv.1804.08588,
  title  = {Large Scale Scene Text Verification with Guided Attention},
  author = {Dafang He and Yeqing Li and Alexander Gorban and Derrall Heath and Julian Ibarz and Qian Yu and Daniel Kifer and C. Lee Giles},
  journal= {arXiv preprint arXiv:1804.08588},
  year   = {2018}
}

备注

18 pages, ACCV 2019