手写文档信息提取的阅读顺序无关指标
计算机视觉与模式识别
2024-04-30 v1
摘要
手写文档中的信息提取过程通常依赖于获取自动转录并在该转录上执行命名实体识别(NER)。因此,在公开可用的数据集中,系统的性能通常使用特定于各数据集的指标进行评估。此外,所采用的大多数指标对阅读顺序错误敏感。因此,它们未能反映系统的预期最终应用,并在更复杂的文档中引入偏差。在本文中,我们提出并公开发布了一组针对手写文档信息提取评估量身定制的阅读顺序无关指标。在我们的实验中,我们对这些指标的行为进行了深入分析,以推荐我们认为正确评估一项任务所需的最小指标集。
引用
@article{arxiv.2404.18664,
title = {Reading Order Independent Metrics for Information Extraction in Handwritten Documents},
author = {David Villanova-Aparisi and Solène Tarride and Carlos-D. Martínez-Hinarejos and Verónica Romero and Christopher Kermorvant and Moisés Pastor-Gadea},
journal= {arXiv preprint arXiv:2404.18664},
year = {2024}
}