中文

重跑OCR:一种用于质量评估与增强预测的机器学习方法

计算与语言 2023-06-22 v5 人工智能 机器学习

摘要

当使用新的、改进的OCR方案进行迭代时,在选定正确的重处理候选对象方面需要进行决策。当底层数据集合规模相当大且在字体、语言、出版时期以及由此导致的OCR质量方面较为多样时,这一点尤其适用。本文记录了卢森堡国家图书馆为支持此类目标选定决策所做的努力。这些决策对于保证低计算开销、降低质量退化风险以及实现更可量化的OCR改进至关重要。特别地,本工作阐述了该图书馆在文本块级质量评估方面的方法。通过对该技术的扩展,还提出了一种能够考虑新OCR引擎增强潜力的回归模型。二者均代表了有前景的方法,尤其适用于处理低质量历史数据的文化机构。

关键词

引用

@article{arxiv.2110.01661,
  title  = {Rerunning OCR: A Machine Learning Approach to Quality Assessment and Enhancement Prediction},
  author = {Pit Schneider and Yves Maurer},
  journal= {arXiv preprint arXiv:2110.01661},
  year   = {2023}
}

备注

Journal of Data Mining and Digital Humanities; Minor revision