一种面向芬兰语的无监督OCR后校正与拼写规范化方法
计算与语言
2020-11-20 v1 机器学习
摘要
历史语料库已知包含数字化过程中使用的OCR(光学字符识别)方法引入的错误,常被认为会降低NLP系统的性能。人工校正这些错误耗时费力,且大量自动方法依赖规则或有监督机器学习。我们基于先前完全自动无监督提取平行数据以训练基于字符的序列到序列NMT(神经机器翻译)模型来进行面向英语的OCR错误校正的工作,并通过提出考虑该语言丰富形态学的方案将其适配到芬兰语。我们的新方法在保持完全无监督的同时展现出性能提升,并附带拼写规范化的益处。源代码与模型已在GitHub和Zenodo上提供。
引用
@article{arxiv.2011.03502,
title = {An Unsupervised method for OCR Post-Correction and Spelling Normalisation for Finnish},
author = {Quan Duong and Mika Hämäläinen and Simon Hengchen},
journal= {arXiv preprint arXiv:2011.03502},
year = {2020}
}