基于多语言句子嵌入的低资源语料过滤
计算与语言
2019-06-24 v1
摘要
在本文中,我们描述了提交给 WMT19 低资源平行语料过滤共享任务的工作。我们的主要方法基于 LASER 工具包(Language-Agnostic SEntence Representations),其使用在平行语料上训练的编码器-解码器架构来获取多语言句子表示。我们随后直接使用这些表示对含噪平行句对进行打分和过滤,而无需额外训练打分函数。我们将我们的方法与其他有前景的方法进行对比,并表明 LASER 产生了强劲的结果。最后,我们集成了多种打分方法并获得了额外增益。我们的提交在尼泊尔语-英语和僧伽罗语-英语 1M 任务上均以 1.3 和 1.4 BLEU 的优势领先于次优系统,取得了最佳总体表现。此外,我们的实验表明该技术在低资源甚至无资源场景下也具有前景。
引用
@article{arxiv.1906.08885,
title = {Low-Resource Corpus Filtering using Multilingual Sentence Embeddings},
author = {Vishrav Chaudhary and Yuqing Tang and Francisco Guzmán and Holger Schwenk and Philipp Koehn},
journal= {arXiv preprint arXiv:1906.08885},
year = {2019}
}
备注
6 pages, WMT 2019