中文

OCR提升低资源语言的机器翻译性能

计算与语言 2022-03-15 v2

摘要

我们旨在研究当前 OCR 系统在低资源语言与低资源文字上的表现。我们引入并公开了一个新颖的基准 OCR4MT,其由真实与合成数据构成,并针对低资源文字下的 60 种低资源语言加入了噪声增强。我们在该基准上评估了最先进的 OCR 系统并分析了最常见的错误。我们表明,当用于反向翻译时,OCR 单语数据是一种可提升机器翻译模型性能的宝贵资源。随后我们进行了消融研究,以探究 OCR 错误如何影响机器翻译性能,并确定使单语数据对机器翻译有用所需的最低 OCR 质量水平。

关键词

引用

@article{arxiv.2202.13274,
  title  = {OCR Improves Machine Translation for Low-Resource Languages},
  author = {Oana Ignat and Jean Maillard and Vishrav Chaudhary and Francisco Guzmán},
  journal= {arXiv preprint arXiv:2202.13274},
  year   = {2022}
}

备注

Accepted at ACL Findings 2022