中文

基于多语言句子嵌入的低资源语料过滤

计算与语言 2019-06-24 v1

摘要

在本文中,我们描述了提交给 WMT19 低资源平行语料过滤共享任务的工作。我们的主要方法基于 LASER 工具包(Language-Agnostic SEntence Representations),其使用在平行语料上训练的编码器-解码器架构来获取多语言句子表示。我们随后直接使用这些表示对含噪平行句对进行打分和过滤,而无需额外训练打分函数。我们将我们的方法与其他有前景的方法进行对比,并表明 LASER 产生了强劲的结果。最后,我们集成了多种打分方法并获得了额外增益。我们的提交在尼泊尔语-英语和僧伽罗语-英语 1M 任务上均以 1.3 和 1.4 BLEU 的优势领先于次优系统,取得了最佳总体表现。此外,我们的实验表明该技术在低资源甚至无资源场景下也具有前景。

关键词

引用

@article{arxiv.1906.08885,
  title  = {Low-Resource Corpus Filtering using Multilingual Sentence Embeddings},
  author = {Vishrav Chaudhary and Yuqing Tang and Francisco Guzmán and Holger Schwenk and Philipp Koehn},
  journal= {arXiv preprint arXiv:1906.08885},
  year   = {2019}
}

备注

6 pages, WMT 2019