中文

公开文档信息抽取基准中的信息冗余与偏差

计算与语言 2023-05-01 v1 人工智能

摘要

视觉丰富文档理解(VrDU)领域尤其是关键信息抽取(KIE)任务的进展,以基于 Transformer 的高效方法(如 LayoutLM 模型)的出现为标志。尽管 KIE 模型在公开基准上微调时表现良好,但在缺乏充足文档标注的复杂真实用例中仍难以泛化。我们的研究强调,诸如 SROIE 和 FUNSD 等 KIE 标准基准包含训练与测试文档之间的显著相似性,可对其调整以更好地评估模型的泛化能力。在这项工作中,我们设计了实验来量化公开基准中的信息冗余,揭示 SROIE 官方测试集中有 75% 的模板复制,FUNSD 中有 16%。我们还提出了重采样策略,以提供更能代表模型泛化能力的基准。我们表明,不适合文档分析的模型在调整后的划分上表现不佳,相较于多模态模型在 SROIE 上仅下降 7.5% F1、在 FUNSD 上仅下降 0.5% F1,这些模型平均下降 10.5% F1(SROIE)和 3.5% F1(FUNSD)。

关键词

引用

@article{arxiv.2304.14936,
  title  = {Information Redundancy and Biases in Public Document Information Extraction Benchmarks},
  author = {Seif Laatiri and Pirashanth Ratnamogan and Joel Tang and Laurent Lam and William Vanhuffel and Fabien Caspani},
  journal= {arXiv preprint arXiv:2304.14936},
  year   = {2023}
}

备注

15 pages, ICDAR 2023 (17th International Conference on Document Analysis and Recognition)