CCAligned:大规模跨语言网页文档对集合
计算与语言
2020-10-13 v2 机器学习
机器学习
摘要
跨语言文档对齐旨在识别两种不同语言中内容可比或互为译文的文档对。本文中,我们利用嵌入在 URL 中的信号,以不同语言对间平均 94.5% 的精度大规模标注网页文档。我们挖掘了 Common Crawl 语料的六十八个快照,并识别出互为译文的网页文档对。我们发布了一个全新的网页数据集,包含来自 Common Crawl 的超过 3.92 亿个 URL 对,覆盖 8144 个语言对的文档,其中 137 个语言对包含英语。除策划此大规模数据集外,我们引入了利用跨语言表示基于文本内容识别对齐文档的基线方法。最后,我们通过并行句子挖掘的下游任务以及测量基于该挖掘数据训练的模型的机器翻译质量,展示了该平行文档数据集的价值。我们发布此数据集的目的在于促进跨低、中、高资源语言的各种跨语言 NLP 新研究。
引用
@article{arxiv.1911.06154,
title = {CCAligned: A Massive Collection of Cross-Lingual Web-Document Pairs},
author = {Ahmed El-Kishky and Vishrav Chaudhary and Francisco Guzman and Philipp Koehn},
journal= {arXiv preprint arXiv:1911.06154},
year = {2020}
}
备注
EMNLP 2020