论无监督双语词典归纳的局限性
计算与语言
2018-05-10 v1 机器学习
机器学习
摘要
无监督机器翻译——即不假设任何跨语言监督信号,无论是词典、翻译还是可比语料库——看似不可能,但尽管如此,Lample 等人(2018)最近提出了一种完全无监督的机器翻译(MT)模型。该模型严重依赖于用于双语词典归纳的单词嵌入空间的对抗式无监督对齐(Conneau 等人,2018),我们在此对其进行了考察。我们的结果揭示了当前无监督 MT 的局限性:当使用来自不同领域或不同嵌入算法的单语料库时,无监督双语词典归纳在不具有依附标记的形态丰富语言上表现差得多。我们展示了一种利用来自相同词的弱监督信号的简单技巧,能够实现更鲁棒的归纳,并建立了无监督双语词典归纳性能与一个此前未被探索的图相似性度量之间的近乎完美的相关性。
引用
@article{arxiv.1805.03620,
title = {On the Limitations of Unsupervised Bilingual Dictionary Induction},
author = {Anders Søgaard and Sebastian Ruder and Ivan Vulić},
journal= {arXiv preprint arXiv:1805.03620},
year = {2018}
}
备注
ACL 2018