面向 PDF 文档表格抽取的图神经网络与表示嵌入
计算机视觉与模式识别
2023-02-21 v1
摘要
表格因能以结构化方式呈现重要信息而广泛用于多类文档。在科学论文中,表格可总结新发现并归纳实验结果,使研究具有可比性且易被学者理解。若干方法基于文档图像进行表格分析,在从 PDF 文件转换过程中丢失有用信息,因为 OCR 工具易出现识别错误,尤其对表格内文本。本工作的主要贡献是利用图神经网络解决表格抽取问题。节点特征通过精心设计的表示嵌入得以丰富。这些表示不仅有助于更好区分表格与论文其他部分,也有助于区分表单元与表头。我们在通过合并 PubLayNet 与 PubTables-1M 数据集提供的信息所得到的新数据集上实验评估了所提方法。
引用
@article{arxiv.2208.11203,
title = {Graph Neural Networks and Representation Embedding for Table Extraction in PDF Documents},
author = {Andrea Gemelli and Emanuele Vivoli and Simone Marinai},
journal= {arXiv preprint arXiv:2208.11203},
year = {2023}
}
备注
ICPR 2022