中文

商业文档信息抽取:迈向实用基准

信息检索 2022-06-23 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

从半结构化文档中抽取信息对于无缝的企业对企业(B2B)通信至关重要。尽管与文档信息抽取(IE)相关的机器学习问题已被研究数十年,许多常见的问题定义和基准并未反映领域特定方面以及自动化B2B文档通信的实际需求。我们回顾了文档IE问题、数据集和基准的概况。我们强调了常见定义中缺失的实际方面,并定义了关键信息定位与抽取(KILE)和行项识别(LIR)问题。由于半结构化商业文档的内容通常受法律保护或属敏感信息,缺乏用于文档IE的相关数据集和基准。我们讨论了可用文档的潜在来源,包括合成数据。

关键词

引用

@article{arxiv.2206.11229,
  title  = {Business Document Information Extraction: Towards Practical Benchmarks},
  author = {Matyáš Skalický and Štěpán Šimsa and Michal Uřičář and Milan Šulc},
  journal= {arXiv preprint arXiv:2206.11229},
  year   = {2022}
}

备注

Accepted to CLEF 2022