中文

用于自然图像文本定位的合成数据

计算机视觉与模式识别 2016-04-25 v1

摘要

本文介绍了一种用于自然图像文本检测的新方法。该方法包含两个贡献:首先,一个快速且可扩展的引擎,用于生成杂乱背景下的合成文本图像。该引擎以自然的方式将合成文本叠加到现有背景图像上,并考虑了局部3D场景几何。其次,我们使用合成图像训练一个全卷积回归网络(FCRN),该网络能在图像的所有位置和多个尺度上高效地执行文本检测和边界框回归。我们讨论了FCRN与最近提出的YOLO检测器以及其他基于深度学习的端到端目标检测系统的关系。由此产生的检测网络显著优于当前的自然图像文本检测方法,在标准ICDAR 2013基准测试上达到了84.2%的F值。此外,它可以在GPU上每秒处理15张图像。

关键词

引用

@article{arxiv.1604.06646,
  title  = {Synthetic Data for Text Localisation in Natural Images},
  author = {Ankush Gupta and Andrea Vedaldi and Andrew Zisserman},
  journal= {arXiv preprint arXiv:1604.06646},
  year   = {2016}
}