Tablext:一种结合神经网络与启发式的表格提取器
信息检索
2021-04-26 v1
摘要
当今可用数据中相当大一部分存在于表格之中。因此,在进行数据挖掘时,有必要使用自动表格提取以获得完整的结果。当今流行的顶尖(state-of-the-art)表格提取方法难以充分提取具有机器可读文本与结构数据的表格。更糟糕的是,许多表格不具备机器可读数据,例如以图像形式保存的表格,这使得大多数提取方法完全失效。为解决这些问题,本文提出一种新颖的通用格式表格提取工具 Tablext。该工具结合计算机视觉技术与机器学习方法,高效且有效地识别和提取表格中的数据。Tablext 首先使用定制的卷积神经网络(CNN)识别并分离所有潜在表格。该识别过程通过将定制 CNN 与 YOLO 目标检测网络相结合而得以优化。随后,利用计算机视觉方法识别每个表格的高层结构。该高层结构元数据被另一个 CNN 用来确定精确的单元格位置。最后一步,对每个独立单元格执行光学字符识别(OCR)以提取其内容,而无需机器可读文本。这种多阶段算法使神经网络专注于完成复杂任务,同时让图像处理方法高效完成较简单的任务。这使得所提方法具有足够的通用性,能够处理大批量的表格,无论其内部编码或布局复杂性如何。此外,它在 ICDAR 2013 表格数据集上的准确性足以超越竞争的顶尖表格提取器。
引用
@article{arxiv.2104.11287,
title = {Tablext: A Combined Neural Network And Heuristic Based Table Extractor},
author = {Zach Colter and Morteza Fayazi and Zineb Benameur-El and Serafina Kamp and Shuyan Yu and Ronald Dreslinski},
journal= {arXiv preprint arXiv:2104.11287},
year = {2021}
}