中文

面向图像中多文本序列识别的纯端到端学习

计算机视觉与模式识别 2019-07-31 v1

摘要

本文研究一个具有挑战性的问题:通过纯端到端学习从图像中识别多个文本序列。该问题包含两方面:1) 多文本序列识别。每幅图像可能包含内容、位置和方向各异的多个文本序列,我们试图识别图像中包含的所有文本序列。2) 纯端到端(PEE)学习。我们以纯端到端学习方式解决该问题,其中每幅训练图像仅以其所含所有序列的文本转写进行标注,无任何几何标注。大多数现有工作以非端到端(NEE)或准端到端(QEE)方式从图像中识别多个文本序列,其中每幅图像同时以文本转写和文本位置进行训练。直到最近,才有一种 PEE 方法被提出用于识别图像中的文本序列,其中文本序列在图像中被分割为多行。然而,它不能直接应用于从图像中识别多个文本序列。因此,本文提出一种纯端到端学习方法以从图像中识别多个文本序列。我们的方法直接学习以每幅输入图像为条件的多个概率分布序列,并通过精心设计的译码策略输出多个文本转写。为评估所提方法,我们主要基于一个现有公共数据集和两个真实应用场景构建了若干数据集。实验结果表明,所提方法能有效从图像中识别多个文本序列,并优于基于 CTC 和基于注意力的基线方法。

关键词

引用

@article{arxiv.1907.12791,
  title  = {Towards Pure End-to-End Learning for Recognizing Multiple Text Sequences from an Image},
  author = {Xu Zhenlong and Zhou shuigeng and Cheng zhanzhan and Bai fan and Niu yi and Pu shiliang},
  journal= {arXiv preprint arXiv:1907.12791},
  year   = {2019}
}