中文

从 Paft 到 Fiiture:一种用于 OCR 后纠错的完全自动 NMT 与词嵌入方法

计算与语言 2020-07-23 v1

摘要

大量历史语料库遭受数字化过程中所用 OCR(光学字符识别)方法引入的错误之苦。人工校正这些错误是耗时过程,且大量自动方法依赖规则或有监督机器学习。我们提出一种完全自动的无监督方法,用于提取平行数据以训练基于字符的序列到序列 NMT(神经机器翻译)模型来进行 OCR 错误校正。

关键词

引用

@article{arxiv.1910.05535,
  title  = {From the Paft to the Fiiture: a Fully Automatic NMT and Word Embeddings Method for OCR Post-Correction},
  author = {Mika Hämäläinen and Simon Hengchen},
  journal= {arXiv preprint arXiv:1910.05535},
  year   = {2020}
}