LAMBERT:用于信息抽取的布局感知(语言)建模
计算与语言
2021-10-05 v5
摘要
我们针对理解文档中 nontrivial 布局影响局部语义的问题,提出了一种简单的新方法。为此,我们修改了 Transformer 编码器架构,使其无需从头重新学习语言语义即可使用从 OCR 系统获得的布局特征。我们仅用 token 边界框的坐标扩充模型输入,从而避免使用原始图像。这产生了一种布局感知语言模型,可随后在下游任务上微调。该模型在使用四个公开数据集(Kleister NDA、Kleister Charity、SROIE 和 CORD)的端到端信息抽取任务上进行了评估。我们表明,我们的模型在由视觉丰富文档组成的数据集上取得了优越性能,同时在具有扁平布局的文档上也优于基线 RoBERTa(NDA 的 从 78.50 提升至 80.42)。我们的解决方案在 SROIE 数据集关键信息抽取的公开排行榜上排名第一,将 SOTA -score 从 97.81 提升至 98.17。
引用
@article{arxiv.2002.08087,
title = {LAMBERT: Layout-Aware (Language) Modeling for information extraction},
author = {Łukasz Garncarek and Rafał Powalski and Tomasz Stanisławek and Bartosz Topolski and Piotr Halama and Michał Turski and Filip Graliński},
journal= {arXiv preprint arXiv:2002.08087},
year = {2021}
}
备注
accepted to ICDAR 2021