中文

TextBoxes++:一种单阶段任意方向场景文本检测器

计算机视觉与模式识别 2018-04-30 v3

摘要

场景文本检测是场景文本识别系统的重要步骤,也是一个具有挑战性的问题。与通用目标检测不同,场景文本检测的主要挑战在于自然图像中文本的任意方向、小尺寸以及显著变化的宽高比。在本文中,我们提出一种端到端可训练的快速场景文本检测器,名为 TextBoxes++,它能在单次网络前向传播中以高精度和高效率检测任意方向的场景文本。除高效的非极大值抑制外,不涉及其他后处理。我们在四个公开数据集上评估了所提出的 TextBoxes++。在所有实验中,TextBoxes++ 在文本定位精度和运行时间上均优于对比方法。更具体地,TextBoxes++ 在 1024*1024 ICDAR 2015 Incidental 文本图像上以 11.6fps 取得 0.817 的 f-measure,在 768*768 COCO-Text 图像上以 19.8fps 取得 0.5591 的 f-measure。此外,结合文本识别器,TextBoxes++ 在流行基准上针对词 spotting 和端到端文本识别任务显著优于最先进的方法。代码见:https://github.com/MhLiao/TextBoxes_plusplus

关键词

引用

@article{arxiv.1801.02765,
  title  = {TextBoxes++: A Single-Shot Oriented Scene Text Detector},
  author = {Minghui Liao and Baoguang Shi and Xiang Bai},
  journal= {arXiv preprint arXiv:1801.02765},
  year   = {2018}
}

备注

15 pages