OCR历史文本误差画像再探
计算机视觉与模式识别
2017-01-20 v1 数字图书馆
摘要
在缺乏真值的情况下,无法自动确定OCR文本中OCR错误的确切频谱与出现次数。然而,对于OCR历史印刷品的交互式后校正而言,若有一个统计画像可用,其提供带有相关频率的错误类别估计,并指向推测错误与可疑词符,则极为有用。Reffle (2013) 引入的方法结合了词典、模式集与高级匹配技术,在一个专门的期望最大化(EM)过程中计算此类画像。在此我们于三方面改进该方法:首先,Reffle (2013) 的方法不具备适应性:通过实际后校正步骤获得的用户反馈无法用于计算精炼的画像。我们引入该方法的一个变体,其对适应性开放,将用户的校正步骤纳入考虑。这针对错误OCR词符的识别带来了更高的精确率。其次,在后校正过程中常发现新的历史模式。我们表明,将新的历史模式添加到语言背景资源中会带来第二种改进,通过区分历史拼写与OCR错误从而实现甚至更高的精确率。第三,Reffle (2013) 的方法并未主动利用那些在底层信道模型中无法解释的词符。我们表明,将这些不可解释的词符添加到推测错误集合中,可显著提升错误检测的召回率,同时提高精确率。
引用
@article{arxiv.1701.05377,
title = {Profiling of OCR'ed Historical Texts Revisited},
author = {Florian Fink and Klaus-U. Schulz and Uwe Springmann},
journal= {arXiv preprint arXiv:1701.05377},
year = {2017}
}