当词嵌入变得濒危
计算与语言
2021-03-25 v1
摘要
英语和芬兰语等大型语言拥有众多自然语言处理(NLP)资源与模型,但低资源与濒危语言并非如此,尽管此类资源能为语言社群带来巨大益处,其数量却极为稀缺。低资源与濒危语言最常见的可用资源类型是翻译词典与通用依存关系。在本文中,我们提出一种利用不同资源丰富语言的现有词嵌入以及资源贫乏语言的翻译词典来构建濒危语言词嵌入的方法。此后,使用通用依存关系中的句子对嵌入进行微调并对齐以匹配大型语言的语义空间,从而得到跨语言词嵌入。我们此处所处理的濒危语言为埃尔齐亚语、莫克沙语、科米-兹良语和斯科尔特萨米语。此外,我们通过利用跨语言词嵌入,为参与本研究的所有语言(无论是否濒危)构建了一个通用情感分析模型。所进行的评估表明,我们的濒危语言词嵌入与资源丰富语言对齐良好,并且适用于训练特定任务模型,正如我们的情感分析模型所展示的那样,其取得了高准确率。我们所有的跨语言词嵌入与情感分析模型已通过一个易于使用的Python库公开发布。
引用
@article{arxiv.2103.13275,
title = {When Word Embeddings Become Endangered},
author = {Khalid Alnajjar},
journal= {arXiv preprint arXiv:2103.13275},
year = {2021}
}