中文

用于扫描金融文档图像中表格检测与表格数据提取的深度结构化特征网络

计算与语言 2022-05-24 v2

摘要

PDF 文档中的自动表格检测已取得巨大成功,但由于检测表格区域的完整性与噪声问题,表格数据提取仍具挑战性。准确的数据提取在金融领域极为关键。受此启发,本研究旨在提出一种从金融 PDF 文档中自动进行表格检测与表格数据提取的方法。我们提出的方法由三个主要过程组成:以 Faster R-CNN(基于区域的卷积神经网络)结合特征金字塔网络(FPN)在每页图像上检测表格区域;基于光学字符识别(OCR)的复合布局分割技术提取内容与结构;以及制定正则表达式规则用于表头分离。表格数据提取功能嵌入了基于规则的过滤与重构函数,具有高度可扩展性。我们标注了一个带表格区域标注的新金融文档数据集用于实验。检测模型优异的表格检测性能来自我们定制的数据集。本文的主要贡献是提出了带表格区域标注的金融文档数据集、优越的检测模型以及用于从 PDF 文件提取表格数据的基于规则的布局分割技术。

关键词

引用

@article{arxiv.2102.10287,
  title  = {Deep Structured Feature Networks for Table Detection and Tabular Data Extraction from Scanned Financial Document Images},
  author = {Siwen Luo and Mengting Wu and Yiwen Gong and Wanying Zhou and Josiah Poon},
  journal= {arXiv preprint arXiv:2102.10287},
  year   = {2022}
}

备注

Works need further review