中文

基于预训练语言模型的鲁棒布局感知富视觉文档信息抽取

计算与语言 2020-05-25 v1 信息检索 机器学习

摘要

现代 NLP 与 IR 流程中处理的许多业务文档是富视觉的:除文本外,其语义也可通过布局、格式和字体等视觉特征来刻画。我们研究了富视觉文档(VRDs)的信息抽取问题,并提出了一种模型,该模型结合大型预训练语言模型与图神经网络的强大能力,以高效编码业务文档中的文本与视觉信息。我们进一步引入新的微调目标,以改进域内无监督微调,从而更好地利用大量未标注的域内数据。我们在真实世界的发票与简历数据集上实验,结果表明所提方法在发票上比强文本基线 RoBERTa 绝对 F1 提升 6.3%,在简历上绝对 F1 提升 4.7%。在少样本设定下评估时,我们的方法仅需基线约 1/30 的标注数据即可在约 90% F1 下达到同等性能。

关键词

引用

@article{arxiv.2005.11017,
  title  = {Robust Layout-aware IE for Visually Rich Documents with Pre-trained Language Models},
  author = {Mengxi Wei and Yifan He and Qiong Zhang},
  journal= {arXiv preprint arXiv:2005.11017},
  year   = {2020}
}

备注

10 pages, to appear in SIGIR 2020 Industry Track