中文

KVP10k: 一个用于商业文档中键值对提取的综合数据集

信息检索 2024-05-02 v1 机器学习

摘要

近年来,从商业文档中提取信息的挑战已成为一项关键任务,在众多领域都有应用。这项工作引起了工业界和学术界的广泛兴趣,凸显了其在当前技术格局中的重要性。该领域的大多数数据集主要关注关键信息提取(KIE),其提取过程围绕使用特定的、预定义的关键字集来提取信息。与大多数现有数据集和基准不同,我们的重点是在不依赖预定义关键字的情况下发现键值对(KVP),并处理各种不同的模板和复杂布局。这项任务提出了独特的挑战,主要是因为缺乏针对非预定义 KVP 提取的综合数据集和基准。为了弥补这一空白,我们引入了 KVP10k,这是一个专门为 KVP 提取设计的新数据集和基准。该数据集包含 10707 张丰富标注的图像。在我们的基准中,我们还引入了一个新的挑战性任务,该任务将 KIE 和 KVP 的元素结合在一个任务中。KVP10k 以其数据的广泛多样性和丰富的详细标注而脱颖而出,为从复杂商业文档中提取信息领域的进步铺平了道路。

关键词

引用

@article{arxiv.2405.00505,
  title  = {KVP10k : A Comprehensive Dataset for Key-Value Pair Extraction in Business Documents},
  author = {Oshri Naparstek and Roi Pony and Inbar Shapira and Foad Abo Dahood and Ophir Azulai and Yevgeny Yaroker and Nadav Rubinstein and Maksym Lysak and Peter Staar and Ahmed Nassar and Nikolaos Livathinos and Christoph Auer and Elad Amrani and Idan Friedman and Orit Prince and Yevgeny Burshtein and Adi Raz Goldfarb and Udi Barzelay},
  journal= {arXiv preprint arXiv:2405.00505},
  year   = {2024}
}

备注

accepted ICDAR2024