PubLayNet:迄今最大的文档版面分析数据集
计算与语言
2019-08-22 v1
摘要
识别非结构化数字文档的版面是将其解析为结构化机器可读格式以供下游应用的重要步骤。为计算机视觉开发的深度神经网络已被证明是分析文档图像版面的有效方法。然而,当前公开可用的文档版面数据集比成熟的计算机视觉数据集小几个数量级。模型必须通过迁移学习从在传统计算机视觉数据集上预训练的基模型进行训练。在本文中,我们通过自动匹配 PubMed Central 上公开可用的超过 100 万篇 PDF 文章的 XML 表示与内容,开发了用于文档版面分析的 PubLayNet 数据集。该数据集的规模与成熟的计算机视觉数据集相当,包含超过 36 万张文档图像,其中标注了典型的文档版面元素。实验表明,在 PubLayNet 上训练的深度神经网络能准确识别科学文章的版面。这些预训练模型也是在不同文档领域上进行迁移学习时更有效的基模型。我们发布该数据集(https://github.com/ibm-aur-nlp/PubLayNet)以支持开发和评估更先进的文档版面分析模型。
引用
@article{arxiv.1908.07836,
title = {PubLayNet: largest dataset ever for document layout analysis},
author = {Xu Zhong and Jianbin Tang and Antonio Jimeno Yepes},
journal= {arXiv preprint arXiv:1908.07836},
year = {2019}
}