中文

基于无监督机器翻译的数据增强改善跨语言词嵌入的结构相似性

计算与语言 2021-06-04 v3

摘要

无监督跨语言词嵌入(CLWE)方法学习一个线性变换矩阵,将分别用单语语料训练得到的两个单语嵌入空间进行映射。该方法依赖于两个嵌入空间结构相似这一假设,而该假设一般而言未必成立。在本文中,我们主张使用由无监督机器翻译模型生成的伪平行语料,可促进两个嵌入空间的结构相似性,并改善无监督映射方法中 CLWE 的质量。我们表明,在给定相同数据量下,我们的方法优于其他替代方法;并且通过详细分析,我们表明利用无监督机器翻译的伪数据进行数据增强对基于映射的 CLWE 尤其有效,因为(1)伪数据使源语言与目标语言语料(部分)平行;(2)伪数据包含关于原始语言的信息,有助于学习源语言与目标语言之间相似的嵌入空间。

关键词

引用

@article{arxiv.2006.00262,
  title  = {Data Augmentation with Unsupervised Machine Translation Improves the Structural Similarity of Cross-lingual Word Embeddings},
  author = {Sosuke Nishikawa and Ryokan Ri and Yoshimasa Tsuruoka},
  journal= {arXiv preprint arXiv:2006.00262},
  year   = {2021}
}

备注

Accepted to ACL-IJCNLP 2021 SRW