突厥语系机器翻译的大规模研究
计算与语言
2021-09-13 v1 机器学习
摘要
神经机器翻译(NMT)的最新进展已将机器翻译系统的质量提升至使其被广泛采用以构建有竞争力系统的程度。然而,仍有大量语言尚未享受到 NMT 的益处。在本文中,我们提供了首个关于机器翻译在突厥语系实际应用的大规模案例研究,旨在实现高资源到极低资源场景下 NMT 对突厥语系的收益。除了提供旨在缓解数据稀缺问题的、识别构建竞争力系统瓶颈的广泛分析外,我们的研究还有几项关键贡献,包括:i) 一个涵盖 22 种突厥语言的大型平行语料库,由公共数据集与约 200 万平行句的新数据集组合而成;ii) 26 个语言对的双语基线;iii) 三个不同翻译领域的高质量新颖测试集;iv) 人工评估分数。所有模型、脚本和数据将向公众发布。
引用
@article{arxiv.2109.04593,
title = {A Large-Scale Study of Machine Translation in the Turkic Languages},
author = {Jamshidbek Mirzakhalov and Anoop Babu and Duygu Ataman and Sherzod Kariev and Francis Tyers and Otabek Abduraufov and Mammad Hajili and Sardana Ivanova and Abror Khaytbaev and Antonio Laverghetta and Behzodbek Moydinboyev and Esra Onal and Shaxnoza Pulatova and Ahsan Wahab and Orhan Firat and Sriram Chellappan},
journal= {arXiv preprint arXiv:2109.04593},
year = {2021}
}
备注
9 pages, 1 figure, 8 tables. Main proceedings of EMNLP 2021