将监督式双语词嵌入从英语映射到低资源语言
计算与语言
2019-10-16 v1
摘要
由于数据不足,处理低资源语言非常具有挑战性。使用词典将独立训练的词嵌入映射到共享向量空间,过去已被证明在学习双语嵌入中非常有用。在此,我们尝试映射英语中单词的独立嵌入及其在低资源语言(如爱沙尼亚语、斯洛文尼亚语、斯洛伐克语和匈牙利语)中对应翻译单词的嵌入。我们采用了监督学习方法。我们通过多种检索策略报告了准确率分数,表明只要拥有至少一定量的合适双语数据,就有可能处理诸如此类语言的机器翻译等自然语言处理中的挑战性任务。我们还得出结论:可以在单语文本数据上采用无监督学习路径,因为这更适用于低资源语言。
引用
@article{arxiv.1910.06411,
title = {Mapping Supervised Bilingual Word Embeddings from English to low-resource languages},
author = {Sourav Dutta},
journal= {arXiv preprint arXiv:1910.06411},
year = {2019}
}
备注
7 pages, 4 tables