一种用于历史文档文本行检测的两阶段方法
计算机视觉与模式识别
2019-07-31 v2
摘要
本文提出一种用于历史文档的两阶段文本行检测方法。每个检测到的文本行由其基线表示。在第一阶段,称为 ARU-Net 的深度神经网络将像素标记为三类之一:基线、分隔符或其他。分隔符类标记每个文本行的起始与结束。ARU-Net 可从零开始训练,仅需可管理数量的少量手动标注示例图像(少于 50 张)。这是通过利用数据增强策略实现的。网络预测用作第二阶段输入,该阶段执行自底向上聚类以构建基线。所开发方法能够处理复杂版式以及弯曲和任意朝向的文本行。它大幅优于当前最先进方法。例如,对于 cBAD: ICDAR2017 基线检测竞赛的复杂赛道,F 值从 0.859 提升至 0.922。用于训练和运行 ARU-Net 的框架是开源的。
引用
@article{arxiv.1802.03345,
title = {A Two-Stage Method for Text Line Detection in Historical Documents},
author = {Tobias Grüning and Gundram Leifert and Tobias Strauß and Johannes Michael and Roger Labahn},
journal= {arXiv preprint arXiv:1802.03345},
year = {2019}
}
备注
to be published in IJDAR