中文

退化文本图像的 OCR 质量

数字图书馆 2007-05-23 v1

摘要

商业 OCR 软件包在高质量扫描图像上表现最佳。当图像发生退化时,无论是由于原件质量差还是由于过度复印,它们往往产生较差的结果。通过图像的统计分析来预测 OCR 的词语失败率的能力,有助于在 OCR 成功率与人工纠错成本之间权衡取舍时做出决策。本文描述了使用标准 OCR 引擎(Adobe Capture)对退化文本图像进行 OCR 的研究。文档选自洛斯阿拉莫斯国家实验室的档案。通过将噪声以受控方式引入完美文档中,我们展示了如何根据噪声的性质预测 OCR 的质量。初步结果表明,简单的噪声模型可以较好地预测 OCR 错误数量。

关键词

引用

@article{arxiv.cs/9902009,
  title  = {Quality of OCR for Degraded Text Images},
  author = {Roger T. Hartley and Kathleen Crumpton},
  journal= {arXiv preprint arXiv:cs/9902009},
  year   = {2007}
}

备注

7 pages