CCMatrix:在万维网上挖掘数十亿高质量平行句对
计算与语言
2020-05-04 v2
摘要
我们展示了在多语言句子空间中基于边界的双语文本挖掘可应用于数十亿句子的单语语料库。我们使用的是经过筛选的 common crawl 语料库(Wenzek 等人,2019)的十个快照,总计 327 亿唯一句子。使用一种针对 38 种语言的统一方法,我们挖掘了 45 亿平行句对,其中 6.61 亿与英语对齐。20 个语言对有超过 3000 万平行句对,112 个超过 1000 万,大多数超过 100 万,包括许多欧洲或亚洲语言之间的直接对齐。为评估所挖掘双语文本的质量,我们为大多数语言对训练了 NMT 系统,并在 TED、WMT 和 WAT 测试集上评估它们。仅使用我们挖掘的双语文本且无人造翻译平行数据,我们在 WMT'19 测试集上实现了英语与德语、俄语和中文之间以及德语/法语翻译的单系统新最先进水平。特别是,我们的英/德系统以近 4 个 BLEU 点优于最佳单系统,并几乎与最佳 WMT'19 评估系统持平,后者使用了系统组合与回译。对于俄语/日语等远距离语言对我们也取得了优异结果,优于 2019 年亚洲翻译研讨会(WAT)的最佳提交。
引用
@article{arxiv.1911.04944,
title = {CCMatrix: Mining Billions of High-Quality Parallel Sentences on the WEB},
author = {Holger Schwenk and Guillaume Wenzek and Sergey Edunov and Edouard Grave and Armand Joulin},
journal= {arXiv preprint arXiv:1911.04944},
year = {2020}
}
备注
13 pages, 4 figures. arXiv admin note: text overlap with arXiv:1907.05791