中文

OCR-Quality:用于 OCR 质量评估的人类标注数据集

计算机视觉与模式识别 2025-10-28 v1 人工智能

摘要

我们提出了 OCR-Quality,一个综合的人类标注数据集,用于评估和开发 OCR 质量评估方法。该数据集由 1000 页 PDF 页面转换为 300 DPI 的 PNG 图像组成,样本来源于多样化的真实场景,包括学术论文、教科书、电子书和多语言文档。每个文档均使用最先进的视觉语言模型(VLM)进行处理,并采用 4 档评分系统(1:优秀,2:良好,3:一般,4:差)进行人工标注。数据集包括详细的来源信息、标注指南以及 various difficulty levels(不同难度级别)的典型案例。OCR-Quality 解决了在实际应用中可靠评估 OCR 质量的关键需求,为训练和评估 OCR 验证系统提供了宝贵的基准数据集。该数据集已公开发布于 https://huggingface.co/datasets/Aslan-mingye/OCR-Quality。

关键词

引用

@article{arxiv.2510.21774,
  title  = {OCR-Quality: A Human-Annotated Dataset for OCR Quality Assessment},
  author = {Yulong Zhang},
  journal= {arXiv preprint arXiv:2510.21774},
  year   = {2025}
}