中文

Brno移动端OCR数据集

计算机视觉与模式识别 2019-07-03 v1

摘要

我们介绍了Brno移动端OCR数据集(B-MOD),用于对手持移动设备拍摄的低质量图像进行文档光学字符识别(OCR)。尽管高质量扫描文档的OCR已是成熟领域,许多商业工具可用,且存在大量自然场景文本数据集,但现有数据集均无法用于开发和测试对移动设备照片中常见的非均匀光照、图像模糊、强噪声、内置去噪、锐化、压缩及其他伪影具有鲁棒性的文档OCR方法。该数据集包含来自随机科学论文的2 113个独特页面,由多人使用23种不同的移动设备拍摄。所得的19 728张不同视觉质量的照片附有500k文本行的精确位置与文本标注。我们进一步提供了一种评估方法,包括一个评估服务器和带有非公开标注的测试集。我们提供了一个基于卷积与循环神经网络并使用连接主义时序分类(CTC)损失训练的最先进文本识别基线。该基线在数据集的简单、中等和困难部分分别取得了2%、22%和73%的词错误率,证实了该数据集具有挑战性。所提出的数据集将赋能未来针对低质量图像的文档分析与评估。它主要用于行级文本识别,并可进一步用于文本行定位、版式分析、图像复原与文本二值化。

关键词

引用

@article{arxiv.1907.01307,
  title  = {Brno Mobile OCR Dataset},
  author = {Martin Kišš and Michal Hradiš and Oldřich Kodym},
  journal= {arXiv preprint arXiv:1907.01307},
  year   = {2019}
}