VILA:利用视觉布局组改进科学 PDF 的结构化内容抽取
计算与语言
2022-01-06 v3 计算机视觉与模式识别
摘要
从 PDF 中准确抽取结构化内容是科学论文自然语言处理的关键第一步。近期工作通过将基本布局信息(例如每个词元在页面上的二维位置)融入语言模型预训练,提升了抽取准确率。我们引入显式建模视觉布局(VILA)组(即文本行或文本块)的新方法,以进一步提升性能。在 I-VILA 方法中,我们表明仅将表示布局组边界的特殊词元插入模型输入即可在词元分类上带来 1.9% 的 Macro F1 提升。在 H-VILA 方法中,我们表明布局组的层次化编码可带来至多 47% 的推理时间缩减,且 Macro F1 损失小于 0.8%。与先前的布局感知方法不同,我们的方法不需要昂贵的额外预训练,仅需微调,我们表明这可将训练成本降低至多 95%。实验在一个新整理的评测套件 S2-VLUE 上进行,其统一了现有自动标注数据集并包含一个覆盖 19 个科学学科多样论文的手动标注新数据集。预训练权重、基准数据集和源代码可在 https://github.com/allenai/VILA 获取。
引用
@article{arxiv.2106.00676,
title = {VILA: Improving Structured Content Extraction from Scientific PDFs Using Visual Layout Groups},
author = {Zejiang Shen and Kyle Lo and Lucy Lu Wang and Bailey Kuehl and Daniel S. Weld and Doug Downey},
journal= {arXiv preprint arXiv:2106.00676},
year = {2022}
}
备注
To appear in TACL 2022. The arXiv version is a pre-MIT Press publication version. (17 pages, 5 figures, 9 tables)