重新审视印度语言在机器翻译中的低资源现状
计算与语言
2020-11-05 v2
摘要
印度语言机器翻译性能受限于缺乏大规模多语言句子对齐语料库和鲁棒基准。本文提供并分析了一个用于获取此类语料库以服务印度语言神经机器翻译(NMT)系统的自动化框架。我们的流水线由一个基线 NMT 系统、一个检索模块和一个对齐模块组成,可用于处理政府新闻稿等公开网站。此项工作的主要贡献在于获得一种增量方法,利用上述流水线迭代扩大语料库规模并改进系统的各个组件。通过我们的工作,我们还评估了诸如枢轴语言的选择以及语料库规模迭代增量增加的效果等设计选择。除了提供自动化框架外,我们的工作还相较于现有可用的印度语言语料库生成了相对更大的语料库。该语料库帮助我们在公开可用的 WAT 评估基准及其他标准评估基准上取得了显著改进的结果。
引用
@article{arxiv.2008.04860,
title = {Revisiting Low Resource Status of Indian Languages in Machine Translation},
author = {Jerin Philip and Shashank Siripragada and Vinay P. Namboodiri and C. V. Jawahar},
journal= {arXiv preprint arXiv:2008.04860},
year = {2020}
}
备注
10 pages, few figures, Preprint under review