基于循环神经网络的鲁棒 PDF 文档转换
摘要
近几十年来,已发布的 PDF 文档数量呈指数增长。人们越来越需要使其丰富内容可被信息检索工具发现。在本文中,我们提出了一种利用循环神经网络直接处理底层 PDF 数据表示来进行 PDF 文档结构恢复的新方法,而非如先前文献所提议的那样依赖对渲染 PDF 页面的视觉重新解释。我们展示了如何将一串 PDF 打印命令用作神经网络的输入,以及网络如何学习根据每个打印命令在页面中的结构功能对其进行分类。该方法有三个优势:首先,它可区分更细粒度的标签(通常为 10-20 个标签,而视觉方法为 1-5 个),从而实现更准确细致的文档结构解析。其次,与视觉方法相比,它能更自然地处理跨页文本流,因为它可拼接连续页面的打印命令。最后,我们提出的方法比视觉方法需要更少内存且计算开销更低。这使我们能以低得多的成本在生产环境中部署此类模型。通过广泛的架构搜索结合高级特征工程,我们实现了在 17 个不同结构标签上加权平均 F1 分数达 97% 的模型。我们取得的最佳模型目前部署于 KDD18(arXiv:1806.02284)上提出的语料库转换服务(Corpus Conversion Service, CCS)的生产环境中。该模型显著增强了 CCS 的能力,因其消除了对每个未见文档版式进行人工标注标签真值的需求。当应用于与 COVID-19 相关的海量 PDF 文章语料库时,这一点尤为有用。
引用
@article{arxiv.2102.09395,
title = {Robust PDF Document Conversion Using Recurrent Neural Networks},
author = {Nikolaos Livathinos and Cesar Berrospi and Maksym Lysak and Viktor Kuropiatnyk and Ahmed Nassar and Andre Carvalho and Michele Dolfi and Christoph Auer and Kasper Dinkla and Peter Staar},
journal= {arXiv preprint arXiv:2102.09395},
year = {2021}
}
备注
9 pages, 2 tables, 4 figures, uses aaai21.sty. Accepted at the "Thirty-Third Annual Conference on Innovative Applications of Artificial Intelligence (IAAI-21)". Received the "IAAI-21 Innovative Application Award"