LayoutReader:用于阅读顺序检测的文本与布局预训练
计算与语言
2021-08-30 v2
摘要
阅读顺序检测是理解视觉富文档(如收据和表格)的基石。遗憾的是,由于标注足够大的数据集过于费时费力,现有工作均未利用先进的深度学习模型。我们观察到,WORD 文档的阅读顺序嵌入在其 XML 元数据中;同时,将 WORD 文档转换为 PDF 或图像十分容易。因此,我们以自动化方式构建了 ReadingBank,这是一个基准数据集,包含涵盖广泛文档类型的 500,000 个文档图像的阅读顺序、文本和布局信息。这一首个大规模数据集释放了深度神经网络在阅读顺序检测中的潜力。具体而言,我们提出的 LayoutReader 使用 seq2seq 模型捕获文本与布局信息以进行阅读顺序预测。它在阅读顺序检测中表现近乎完美,并在我们的实验中显著提升了开源与商业 OCR 引擎在其结果中对文本行进行排序的能力。我们将在 \url{https://aka.ms/layoutreader} 发布该数据集与模型。
引用
@article{arxiv.2108.11591,
title = {LayoutReader: Pre-training of Text and Layout for Reading Order Detection},
author = {Zilong Wang and Yiheng Xu and Lei Cui and Jingbo Shang and Furu Wei},
journal= {arXiv preprint arXiv:2108.11591},
year = {2021}
}
备注
EMNLP 2021