中文

LAMBERT:用于信息抽取的布局感知(语言)建模

计算与语言 2021-10-05 v5

摘要

我们针对理解文档中 nontrivial 布局影响局部语义的问题,提出了一种简单的新方法。为此,我们修改了 Transformer 编码器架构,使其无需从头重新学习语言语义即可使用从 OCR 系统获得的布局特征。我们仅用 token 边界框的坐标扩充模型输入,从而避免使用原始图像。这产生了一种布局感知语言模型,可随后在下游任务上微调。该模型在使用四个公开数据集(Kleister NDA、Kleister Charity、SROIE 和 CORD)的端到端信息抽取任务上进行了评估。我们表明,我们的模型在由视觉丰富文档组成的数据集上取得了优越性能,同时在具有扁平布局的文档上也优于基线 RoBERTa(NDA 的 F1F_{1} 从 78.50 提升至 80.42)。我们的解决方案在 SROIE 数据集关键信息抽取的公开排行榜上排名第一,将 SOTA F1F_{1}-score 从 97.81 提升至 98.17。

关键词

引用

@article{arxiv.2002.08087,
  title  = {LAMBERT: Layout-Aware (Language) Modeling for information extraction},
  author = {Łukasz Garncarek and Rafał Powalski and Tomasz Stanisławek and Bartosz Topolski and Piotr Halama and Michał Turski and Filip Graliński},
  journal= {arXiv preprint arXiv:2002.08087},
  year   = {2021}
}

备注

accepted to ICDAR 2021