中文

用于平行语料挖掘的分层文档编码器

计算与语言 2019-07-02 v2

摘要

我们探索使用多语言文档嵌入进行平行数据的近邻挖掘。考察了三种文档级表示:(i) 通过简单平均多语言句子嵌入生成的文档嵌入;(ii) 神经词袋(BoW)文档编码模型;(iii) 构建于我们句子级模型之上的分层多语言文档编码器(HiDE)。结果表明,由句子级平均导出的文档嵌入对干净数据集出奇地有效,但暗示在文档级分层训练的模型在噪声数据上更有效。分析实验表明我们的分层模型对底层句子嵌入质量的变化非常鲁棒。使用 HiDE 训练的文档嵌入在联合国(UN)平行文档挖掘上达到最先进性能,en-fr 的 P@1 为 94.9%,en-es 的 P@1 为 97.3%。

关键词

引用

@article{arxiv.1906.08401,
  title  = {Hierarchical Document Encoder for Parallel Corpus Mining},
  author = {Mandy Guo and Yinfei Yang and Keith Stevens and Daniel Cer and Heming Ge and Yun-Hsuan Sung and Brian Strope and Ray Kurzweil},
  journal= {arXiv preprint arXiv:1906.08401},
  year   = {2019}
}

备注

accepted by WMT2019