中文

Form-NLU:表单自然语言理解数据集

信息检索 2023-08-04 v3

摘要

相较于通用文档分析任务,表单文档结构理解与检索颇具挑战。表单文档通常由两类作者制作:表单设计者,其开发表单结构与键;以及表单使用者,其依据所给键填写表单值。因此,若表单使用者产生混淆,表单值可能与表单设计者的意图(结构与键)不对齐。本文引入Form-NLU,首个用于表单结构理解及其键值信息抽取的崭新数据集,用以解读表单设计者意图及使用者所写值在其上的对齐。它包含857张表单图像、6k个表单键与值,以及4k个表格键与值。我们的数据集还涵盖三种表单类型:数字、打印与手写,覆盖多样的表单外观与版式。我们提出一种基于鲁棒位置与逻辑关系的表单键值信息抽取框架。利用该数据集Form-NLU,我们首先考察强目标检测模型用于表单版式理解,继而评估数据集上的关键信息抽取任务,给出针对不同表单与键类型的细粒度结果。此外,我们以现成pdf版式抽取工具测试之,证明其于真实场景中的可行性。

关键词

引用

@article{arxiv.2304.01577,
  title  = {Form-NLU: Dataset for the Form Natural Language Understanding},
  author = {Yihao Ding and Siqu Long and Jiabin Huang and Kaixuan Ren and Xingxiang Luo and Hyunsuk Chung and Soyeon Caren Han},
  journal= {arXiv preprint arXiv:2304.01577},
  year   = {2023}
}

备注

Accepted by SIGIR 2023