中文

揭示预训练文本与版面模型在真实世界视觉富文档信息抽取中的缺陷

计算与语言 2025-04-15 v2

摘要

最近开发的预训练文本与版面模型在视觉富文档的多个信息抽取任务中取得了显著成功。然而,尽管在基准测试上取得了极高的性能,它们在真实世界中的表现却未达预期。针对这一问题,我们调查了现有的评估流程,并发现:(1)基准数据集中不充分的标注在任务输入和标签之间引入了虚假相关性,这会导致对模型性能的过度乐观估计。(2)评估仅依赖于基准测试上的表现,不足以全面探索方法在真实世界场景中的能力。这些问题阻碍了现有评估流程反映方法在真实世界中的性能,误导了方法优化的设计选择。在这项工作中,我们引入了 EC-FUNSD,一个为视觉富文档信息抽取基准测试而精心制作的以实体为中心的数据集。该数据集包含多样化的版面和高质量的标注。此外,该数据集解开了由 FUNSD 的块级标注引起的错误耦合的片段和实体标注。使用所提出的数据集,我们从多个方面评估了 PTLM 在真实世界信息抽取中的能力,包括它们的绝对性能,以及泛化能力、鲁棒性和公平性。结果表明,流行的 PTLM 在真实世界信息抽取场景中的表现并不如预期的那样好。我们希望我们的研究能激发对 PTLM 发展方向的反思。

关键词

引用

@article{arxiv.2402.02379,
  title  = {Unveiling the Deficiencies of Pre-trained Text-and-Layout Models in Real-world Visually-rich Document Information Extraction},
  author = {Chong Zhang and Yixi Zhao and Yulu Xie and Chenshu Yuan and Yi Tu and Ya Guo and Mingxu Chai and Ziyu Shen and Yue Zhang and Qi Zhang},
  journal= {arXiv preprint arXiv:2402.02379},
  year   = {2025}
}