OCR提升低资源语言的机器翻译性能
计算与语言
2022-03-15 v2
摘要
我们旨在研究当前 OCR 系统在低资源语言与低资源文字上的表现。我们引入并公开了一个新颖的基准 OCR4MT,其由真实与合成数据构成,并针对低资源文字下的 60 种低资源语言加入了噪声增强。我们在该基准上评估了最先进的 OCR 系统并分析了最常见的错误。我们表明,当用于反向翻译时,OCR 单语数据是一种可提升机器翻译模型性能的宝贵资源。随后我们进行了消融研究,以探究 OCR 错误如何影响机器翻译性能,并确定使单语数据对机器翻译有用所需的最低 OCR 质量水平。
引用
@article{arxiv.2202.13274,
title = {OCR Improves Machine Translation for Low-Resource Languages},
author = {Oana Ignat and Jean Maillard and Vishrav Chaudhary and Francisco Guzmán},
journal= {arXiv preprint arXiv:2202.13274},
year = {2022}
}
备注
Accepted at ACL Findings 2022