LAME:面向研究论文的版面感知元数据抽取方法
机器学习
2021-12-24 v1 数字图书馆
信息检索
摘要
学术文献(如学术会议论文与期刊)的数量在全球范围内迅速增长,关于元数据抽取的研究也在持续开展。然而,由于不同期刊出版商的版面格式多样,高性能的元数据抽取仍具挑战性。为应对学术期刊版面的多样性,我们提出了一种新颖的版面感知元数据抽取(LAyout-aware Metadata Extraction, LAME)框架,具备三大特征(例如,自动版面分析的设计、大规模元数据训练集的构建,以及Layout-MetaBERT的构建)。我们利用PDFMiner设计了自动版面分析。基于该版面分析,自动抽取了大量分离元数据的训练数据,包括标题、摘要、作者姓名、作者所属机构以及关键词。此外,我们构建了Layout-MetaBERT以从具有不同版面格式的学术期刊中抽取元数据。Layout-MetaBERT的实验结果在针对具有不同版面格式的未知期刊的元数据抽取中表现出鲁棒性能(Macro-F1为93.27%)。
引用
@article{arxiv.2112.12353,
title = {LAME: Layout Aware Metadata Extraction Approach for Research Articles},
author = {Jongyun Choi and Hyesoo Kong and Hwamook Yoon and Heung-Seon Oh and Yuchul Jung},
journal= {arXiv preprint arXiv:2112.12353},
year = {2021}
}