利用基于图的词嵌入进行低资源双语词典抽取
计算与语言
2017-10-10 v1
摘要
在本工作中,我们关注为西班牙语-纳瓦特尔语对自动抽取双语词典的任务。这是一个低资源设定,仅有少量平行语料库可用。大多数下游方法在低资源条件下表现不佳。对于使用 Word2Vec 等向量表示的方法而言尤其如此。我们的提议是从图构建双语词向量。该图是使用从无监督词对齐方法获得的翻译对生成的。我们表明,在低资源设定下,这类向量能够成功地在双语语义空间中表示词汇。此外,当应用线性变换将词汇从一种语言翻译为另一种语言时,我们基于图的表示显著优于使用 Word2Vec 的流行设定。
引用
@article{arxiv.1710.02569,
title = {Low-resource bilingual lexicon extraction using graph based word embeddings},
author = {Ximena Gutierrez-Vasques and Victor Mijangos},
journal= {arXiv preprint arXiv:1710.02569},
year = {2017}
}
备注
Draft accepted in MICAI-IJCLA