基于对齐词嵌入的乌拉尔语系情感分析
计算与语言
2023-05-25 v1
摘要
在本文中,我们提出了一种将多数语言的词嵌入翻译为4种少数民族语言的方法:埃尔齐亚语、莫克沙语、乌德穆尔特语和科米-兹梁语。此外,我们对这些词嵌入进行对齐,并提出一种新颖的神经网络模型,该模型在英语数据上训练以进行情感分析,随后通过对齐的词嵌入应用于濒危语言数据。为测试我们的模型,我们为这4种濒危语言以及芬兰语标注了一个小型情感分析语料库。我们的方法对每种濒危语言均达到了至少56%的准确率。模型与情感语料库将随本文一同发布。我们的研究表明,最先进的神经模型(state-of-the-art neural models)可用于濒危语言,唯一要求为濒危语言与多数语言之间的一部词典。
引用
@article{arxiv.2305.15380,
title = {Sentiment Analysis Using Aligned Word Embeddings for Uralic Languages},
author = {Khalid Alnajjar and Mika Hämäläinen and Jack Rueter},
journal= {arXiv preprint arXiv:2305.15380},
year = {2023}
}
备注
Proceedings of the Second Workshop on Resources and Representations for Under-Resourced Languages and Domains (RESOURCEFUL-2023)