中文

面向富视觉文档评估的文档智能度量

人工智能 2022-05-24 v1

摘要

富视觉文档 (VRD) 的处理在与文档智能相关的信息抽取任务中极为重要。我们介绍了 DI-Metrics,一个致力于 VRD 模型评估的 Python 库,包含用于信息抽取任务的基于文本、基于几何与基于层级的度量。我们应用 DI-Metrics 使用公开可用的 CORD 数据集评估信息抽取性能,比较了三个 SOTA 模型与一个工业模型的表现。该开源库发布于 GitHub。

关键词

引用

@article{arxiv.2205.11215,
  title  = {Document Intelligence Metrics for Visually Rich Document Evaluation},
  author = {Jonathan DeGange and Swapnil Gupta and Zhuoyu Han and Krzysztof Wilkosz and Adam Karwan},
  journal= {arXiv preprint arXiv:2205.11215},
  year   = {2022}
}

备注

Accepted to DAS 2022, 15TH IAPR INTERNATIONAL WORKSHOP ON DOCUMENT ANALYSIS SYSTEMS