JParaCrawl v3.0:大规模英日平行语料库
计算与语言
2022-03-01 v2
摘要
当前大多数机器翻译模型主要使用平行语料库进行训练,其翻译精度在很大程度上取决于语料库的质量与数量。尽管少数语言对拥有数十亿平行句对,但由于缺乏公开可用的平行语料库,有效处理大多数语言对仍十分困难。本文针对英日这一相较于英德等资源丰富语言对而言可用资源有限的语言对,构建了大规樀平行语料库。我们引入了名为JParaCrawl v3.0的新型基于网络的英日平行语料库。我们的新语料库包含超过2100万条唯一平行句对,是先前JParaCrawl v2.0语料库的两倍以上。通过实验,我们实证展示了新语料库如何在多个领域提升机器翻译模型的精度。JParaCrawl v3.0语料库最终将公开在线提供以供研究使用。
引用
@article{arxiv.2202.12607,
title = {JParaCrawl v3.0: A Large-scale English-Japanese Parallel Corpus},
author = {Makoto Morishita and Katsuki Chousa and Jun Suzuki and Masaaki Nagata},
journal= {arXiv preprint arXiv:2202.12607},
year = {2022}
}
备注
7 pages