中文

定位扫描文档中的表格以进行重建与再发布 (ICIAfS14)

计算机视觉与模式识别 2014-12-25 v1

摘要

人类可用的知识库取决于学习资源的来源,这些资源可从古代印刷文档变化到现代电子材料。若要保持电子文档的格式和外观与其印刷版本完全一致,将传统图书馆中的资料快速转换为数字形式需要大量工作。大多数印刷文档不仅包含字符及其格式,还包含表格、图表和图形对象等相关非文本对象。检测这些对象并在复现时专注于内容的格式保持具有挑战性。为解决这一问题,我们提出了一种利用词间距和行高的局部阈值算法,从扫描文档图像中定位并提取各类表格。通过对 298 份文档进行的实验,我们得出结论:该算法在从扫描文档图像中检测表格方面的总体准确率约为 75%。由于该算法不完全依赖规则线,它能够检测具有不同字体类型、样式和大小的各类扫描文档中的所有类别表格,并提取其格式特征。此外,只需对版面分析稍作修改,该算法即可应用于定位多栏布局中的表格。保留表格现有的格式特征将极大地有助于印刷文档的再版和更新。

关键词

引用

@article{arxiv.1412.7689,
  title  = {Locating Tables in Scanned Documents for Reconstructing and Republishing (ICIAfS14)},
  author = {Akmal Jahan Mac and Roshan G Ragel},
  journal= {arXiv preprint arXiv:1412.7689},
  year   = {2014}
}

备注

The 7th International Conference on Information and Automation for Sustainability (ICIAfS) 2014