中文

我们真的需要完全无监督的跨语言词嵌入吗

计算与语言 2019-09-05 v1

摘要

近期跨语言词嵌入(CLWE)学习的研究主要集中于完全无监督方法,这类方法在没有任何跨语言信号的情况下将单语嵌入投影到共享的跨语言空间中。缺乏任何监督使得此类方法在概念上具有吸引力。然而,它们与(弱)监督的基于投影的 CLWE 方法唯一的核心区别在于获取用于初始化迭代自学习过程的种子词典的方式。完全无监督方法可以说已变得更加鲁棒,其主要用例是针对资源贫乏且远距离语言对的 CLWE 归纳。在本文中,我们质疑即便是最鲁棒的的无监督 CLWE 方法在这些更具挑战性的设定下归纳出有意义 CLWE 的能力。一组涵盖 15 种多样化语言(210 个语言对)的双语词典归纳(BLI)实验表明,完全无监督 CLWE 方法在大量语言对上仍然失败(例如,在 210 个语言对中有 87 个的 BLI 性能为零)。即便成功时,它们在任何 BLI 设定下也从未超越使用相同自学习过程、以 500–1000 个翻译对作为种子的弱监督方法的性能,且差距往往很大。这些发现呼吁重新审视完全无监督 CLWE 方法背后的主要动机。

关键词

引用

@article{arxiv.1909.01638,
  title  = {Do We Really Need Fully Unsupervised Cross-Lingual Embeddings?},
  author = {Ivan Vulić and Goran Glavaš and Roi Reichart and Anna Korhonen},
  journal= {arXiv preprint arXiv:1909.01638},
  year   = {2019}
}

备注

EMNLP 2019 (Long paper)