TSR-DSAW:基于词深度空间关联的表格结构识别
计算机视觉与模式识别
2022-03-15 v1
摘要
现有的从相机拍摄或扫描文档中进行表格结构识别(TSR)的方法,在由嵌套行/列、多行文本和缺失单元格数据组成的复杂表格上表现不佳。这是因为当前数据驱动的方法只是简单地在大量数据上训练深度模型,并在遇到未见过的表格结构时无法泛化。在本文中,我们提出训练一个深度网络来捕获表格图像中不同词对之间的空间关联,以解析表格结构。我们提出了一个端到端流水线,名为 TSR-DSAW:基于词深度空间关联的表格结构识别(TSR via Deep Spatial Association of Words),其以 HTML 等结构化格式输出表格图像的数字表示。给定表格图像作为输入,所提方法首先使用如 CRAFT 之类的文本检测网络检测图像中存在的所有词,随后使用动态规划生成词对。这些词对在单独图像中被高亮显示,接着被输入到训练用于捕获同行、同列、同单元格或无关联等空间关联的 DenseNet-121 分类器中。最后,我们对分类器输出进行后处理以生成 HTML 格式的表格结构。我们在两个公开表格图像数据集——PubTabNet 和 ICDAR 2013 上评估了我们的 TSR-DSAW 流水线,并展示了相对于 TableNet 和 DeepDeSRT 等先前方法的改进。
引用
@article{arxiv.2203.06873,
title = {TSR-DSAW: Table Structure Recognition via Deep Spatial Association of Words},
author = {Arushi Jain and Shubham Paliwal and Monika Sharma and Lovekesh Vig},
journal= {arXiv preprint arXiv:2203.06873},
year = {2022}
}
备注
6 pages, 1 figure, 1 table, ESANN 2021 proceedings, European Symposium on Artificial Neural Networks, Computational Intelligence and Machine Learning. Online event, 6-8 October 2021, i6doc.com publ., ISBN 978287587082-7