面向富视觉文档评估的文档智能度量
人工智能
2022-05-24 v1
摘要
富视觉文档 (VRD) 的处理在与文档智能相关的信息抽取任务中极为重要。我们介绍了 DI-Metrics,一个致力于 VRD 模型评估的 Python 库,包含用于信息抽取任务的基于文本、基于几何与基于层级的度量。我们应用 DI-Metrics 使用公开可用的 CORD 数据集评估信息抽取性能,比较了三个 SOTA 模型与一个工业模型的表现。该开源库发布于 GitHub。
引用
@article{arxiv.2205.11215,
title = {Document Intelligence Metrics for Visually Rich Document Evaluation},
author = {Jonathan DeGange and Swapnil Gupta and Zhuoyu Han and Krzysztof Wilkosz and Adam Karwan},
journal= {arXiv preprint arXiv:2205.11215},
year = {2022}
}
备注
Accepted to DAS 2022, 15TH IAPR INTERNATIONAL WORKSHOP ON DOCUMENT ANALYSIS SYSTEMS