中文

FATURA:用于文档分析与理解的多版式发票图像数据集

计算机视觉与模式识别 2023-11-21 v1

摘要

文档分析与理解模型通常需要大量标注数据来进行训练。然而,各种文档相关任务超越了单纯的文本转写,需要文本内容以及精确的边界框标注来识别不同的文档元素。收集此类数据变得尤其具有挑战性,特别是在发票场景下,隐私问题增加了额外的复杂性。本文中,我们介绍FATURA,一个面向文档分析与理解领域研究人员的核心资源。FATURA是一个高度多样化的数据集,具有多版式、已标注的发票文档图像。其包含10,00010,000张具有5050种不同版式的发票,是迄今已知最大的开放可获取的发票文档图像数据集。我们还为各种文档分析与理解任务提供了全面的基准,并在多种训练与评估场景下进行了实验。该数据集可在 https://zenodo.org/record/8261508 免费获取,助力研究人员推进文档分析与理解领域的发展。

关键词

引用

@article{arxiv.2311.11856,
  title  = {FATURA: A Multi-Layout Invoice Image Dataset for Document Analysis and Understanding},
  author = {Mahmoud Limam and Marwa Dhiaf and Yousri Kessentini},
  journal= {arXiv preprint arXiv:2311.11856},
  year   = {2023}
}