BADAM:一个用于阿拉伯文手写本基线检测的公开数据集
计算机视觉与模式识别
2019-07-10 v1
摘要
手写文本识别在历史文献中的应用高度依赖于准确的文本行提取。近来出现了若干利用稳健基线检测范式的系统,但针对具有挑战性文字的版面分析方法的进展受限于缺乏包含非拉丁文字文献的成熟数据集。我们提出一个包含来自不同领域与时期的 400 张标注文档图像的数据集。文中简要阐述了阿拉伯文手写体在版面分析及后续处理步骤中所带来的特殊挑战。最后,我们提出了一种基于全卷积编码器-解码器网络的方法,以从手写本中提取任意形状的文本行图像。
引用
@article{arxiv.1907.04041,
title = {BADAM: A Public Dataset for Baseline Detection in Arabic-script Manuscripts},
author = {Benjamin Kiessling and Daniel Stökl Ben Ezra and Matthew Thomas Miller},
journal= {arXiv preprint arXiv:1907.04041},
year = {2019}
}