中文

Kleister:涉及复杂版式长文档的关键信息抽取数据集

计算与语言 2022-11-28 v1

摘要

关键信息抽取(KIE)任务在自然语言处理问题中的相关性日益重要。但迄今为止,作为该领域解决方案基准的明确定义问题仍寥寥无几。为弥补这一差距,我们引入两个新数据集(Kleister NDA 和 Kleister Charity)。它们包含扫描件与数字原生长篇幅正式英文文档的混合。在这些数据集中,NLP 系统需利用文本与结构版式特征来查找或推断各类实体。Kleister Charity 数据集由 2,788 份慈善组织年度财务报告组成,含 61,643 个唯一页面和 21,612 个待抽取实体。Kleister NDA 数据集有 540 份保密协议,含 3,229 个唯一页面和 2,160 个待抽取实体。我们提供了来自 KIE 领域的若干最先进基线系统(Flair、BERT、RoBERTa、LayoutLM、LAMBERT),表明我们的数据集对现有模型构成强劲挑战。最佳模型在 Kleister NDA 和 Kleister Charity 数据集上分别取得了 81.77% 和 83.57% 的 F1 值。我们共享这些数据集以推动更深入和复杂的信息抽取任务取得进展。

关键词

引用

@article{arxiv.2105.05796,
  title  = {Kleister: Key Information Extraction Datasets Involving Long Documents with Complex Layouts},
  author = {Tomasz Stanisławek and Filip Graliński and Anna Wróblewska and Dawid Lipiński and Agnieszka Kaliska and Paulina Rosalska and Bartosz Topolski and Przemysław Biecek},
  journal= {arXiv preprint arXiv:2105.05796},
  year   = {2022}
}

备注

accepted to ICDAR 2021