中文

字符误差向量:用于页面级 OCR 评估的可分解误差

计算机视觉与模式识别 2026-04-08 v1 机器学习

摘要

字符误差率(CER)是评估光学字符识别(OCR)质量的关键指标,但该指标假设文本已被完美解析,这在实际中常不成立。在页面解析错误的情况下,CER 变为未定义的,限制了其作为指标的使用,使得在使用不共享标注方案的数据进行页面级 OCR 评估变得具有挑战性。我们引入字符误差向量(CEV),一种用于 OCR 的袋装字符评估器。CEV 可分解为解析、OCR 以及交互误差组成部分。这种可分解性允许实践者聚焦于文档理解管道中对整体文本提取质量影响最大的部分。CEV 可通过多种方法实现,其中我们演示了 SpACER(Spatially Aware Character Error Rate)和基于 Jensen-Shannon 距离的字符分布方法。我们对 CEV 的性能进行了验证:首先,其与 CER 的关系;其次,解析质量;最后,作为页面级 OCR 质量的直接度量。验证过程表明,CEV 是解析指标与局部指标如 CER 之间有价值的桥梁。我们分析了由退化图像和复杂版面结构组成的档案报纸数据集,发现最先进的端到端模型被更传统的管道方法超越。尽管 CEV 需要字符级别的位置信息以实现最佳 triage,但基于易获得值的阈值可以 0.91 的 F1 分数预测主要误差来源。我们提供 CEV 作为 Python 库的一部分,以支持文档理解研究。

关键词

引用

@article{arxiv.2604.06160,
  title  = {The Character Error Vector: Decomposable errors for page-level OCR evaluation},
  author = {Jonathan Bourne and Mwiza Simbeye and Joseph Nockels},
  journal= {arXiv preprint arXiv:2604.06160},
  year   = {2026}
}

备注

6643 words, 5 figures, 15 tables