基于主动学习的历史文档字体识别
计算机视觉与模式识别
2016-01-28 v1 人工智能
数字图书馆
应用统计
机器学习
摘要
识别历史文档中所用字体类型(如罗马体、哥特黑体)可帮助光学字符识别(OCR)系统生成更精确的文本转录。为此,我们提出一种主动学习策略,能显著减少训练字体分类器所需的标注样本数量。我们的方法提取基于图像的特征,利用单词级别上字体间的几何差异,并将其组合为文档每页的词袋表示。我们基于不确定性、相异性和多样性准则评估了六种采样策略,并在包含 3000 余份哥特黑体、罗马体与混合字体历史文档的数据库上测试。结果表明,不确定性与多样性的组合在仅需标注少量数据(17%)的情况下取得了最高预测准确率(89% 测试用例正确分类)。我们讨论了该结果对历史文档大规模数字化项目的意义。
引用
@article{arxiv.1601.07252,
title = {Font Identification in Historical Documents Using Active Learning},
author = {Anshul Gupta and Ricardo Gutierrez-Osuna and Matthew Christy and Richard Furuta and Laura Mandell},
journal= {arXiv preprint arXiv:1601.07252},
year = {2016}
}