中文

TableNet:用于扫描文档图像中端到端表格检测与表格数据提取的深度学习模型

计算机视觉与模式识别 2020-01-07 v1 机器学习 图像与视频处理

摘要

随着手机和扫描仪拍摄并上传文档的广泛使用,从零售收据、保险索赔表和财务发票等非结构化文档图像中提取信息的需求变得愈发迫切。实现这一目标的一大障碍是这些图像中的信息常以表格形式呈现,而从表格子图像中提取数据带来了一系列独特的挑战。这包括在图像中准确检测表格区域,以及随后从检测到的表格的行和列中检测和提取信息。虽然在表格检测方面已取得一些进展,但提取表格内容仍具挑战性,因为这涉及更细粒度的表格结构(行和列)识别。先前的方法尝试使用两个独立模型分别解决表格检测和结构识别问题。在本文中,我们提出 TableNet:一种用于表格检测和结构识别的新型端到端深度学习模型。该模型利用表格检测与表格结构识别这两个孪生任务之间的相互依赖性来分割出表格和列区域。随后基于语义规则从已识别的表格子区域中提取行。所提出的模型和提取方法在公开可用的 ICDAR 2013 和 Marmot Table 数据集上进行了评估,取得了最先进(SOTA)的结果。此外,我们证明了馈入额外的语义特征可进一步提升模型性能,并且该模型展现出跨数据集的迁移学习。本文的另一贡献是为 Marmot 数据提供了额外的表格结构标注,该数据目前仅有表格检测标注。

关键词

引用

@article{arxiv.2001.01469,
  title  = {TableNet: Deep Learning model for end-to-end Table detection and Tabular data extraction from Scanned Document Images},
  author = {Shubham Paliwal and Vishwanath D and Rohit Rahul and Monika Sharma and Lovekesh Vig},
  journal= {arXiv preprint arXiv:2001.01469},
  year   = {2020}
}