从 Paft 到 Fiiture:一种用于 OCR 后纠错的完全自动 NMT 与词嵌入方法
计算与语言
2020-07-23 v1
摘要
大量历史语料库遭受数字化过程中所用 OCR(光学字符识别)方法引入的错误之苦。人工校正这些错误是耗时过程,且大量自动方法依赖规则或有监督机器学习。我们提出一种完全自动的无监督方法,用于提取平行数据以训练基于字符的序列到序列 NMT(神经机器翻译)模型来进行 OCR 错误校正。
引用
@article{arxiv.1910.05535,
title = {From the Paft to the Fiiture: a Fully Automatic NMT and Word Embeddings Method for OCR Post-Correction},
author = {Mika Hämäläinen and Simon Hengchen},
journal= {arXiv preprint arXiv:1910.05535},
year = {2020}
}