Tatoeba 翻译挑战——面向低资源与多语言机器翻译的现实数据集
计算与语言
2020-10-14 v1
摘要
本文描述了一个新的机器翻译基准的开发,该基准为涵盖 500 多种语言的数千个语言对提供训练和测试数据,并提供从该集合中创建最先进翻译模型的工具。主要目标是推动具有更广泛世界语言覆盖度的开放翻译工具和模型的发展。使用该包可以处理现实的低资源场景,避免演示零样本或少样本学习时常见的人为缩减设置。该包首次提供了数百种语言的多样化数据集综合集合,带有系统的语言和文字标注及数据划分,以扩展现有基准的狭窄覆盖范围。连同数据发布,我们还提供了不断增长的针对单独语言对和选定语言组的预训练基线模型。
引用
@article{arxiv.2010.06354,
title = {The Tatoeba Translation Challenge -- Realistic Data Sets for Low Resource and Multilingual MT},
author = {Jörg Tiedemann},
journal= {arXiv preprint arXiv:2010.06354},
year = {2020}
}
备注
to be appear at the 5th Conference on Machine Translation (WMT20)