用于平行语料挖掘的分层文档编码器
计算与语言
2019-07-02 v2
摘要
我们探索使用多语言文档嵌入进行平行数据的近邻挖掘。考察了三种文档级表示:(i) 通过简单平均多语言句子嵌入生成的文档嵌入;(ii) 神经词袋(BoW)文档编码模型;(iii) 构建于我们句子级模型之上的分层多语言文档编码器(HiDE)。结果表明,由句子级平均导出的文档嵌入对干净数据集出奇地有效,但暗示在文档级分层训练的模型在噪声数据上更有效。分析实验表明我们的分层模型对底层句子嵌入质量的变化非常鲁棒。使用 HiDE 训练的文档嵌入在联合国(UN)平行文档挖掘上达到最先进性能,en-fr 的 P@1 为 94.9%,en-es 的 P@1 为 97.3%。
引用
@article{arxiv.1906.08401,
title = {Hierarchical Document Encoder for Parallel Corpus Mining},
author = {Mandy Guo and Yinfei Yang and Keith Stevens and Daniel Cer and Heming Ge and Yun-Hsuan Sung and Brian Strope and Ray Kurzweil},
journal= {arXiv preprint arXiv:1906.08401},
year = {2019}
}
备注
accepted by WMT2019