中文

一种用于罗马乌尔都语情感分析的精确极端多通道混合方法

计算与语言 2020-03-13 v1

摘要

为加速罗马乌尔都语各类自然语言处理任务的性能,本文首次提供了使用最广泛的方法即 Word2vec、FastText 与 Glove 训练的 3 个神经词嵌入。所生成神经词嵌入的完整性通过内在与外在评估方法进行评价。考虑到缺乏公开可用的基准数据集,本文提供了一个首创的罗马乌尔都语数据集,包含针对正、负、中性类别标注的 3241 条情感数据。为在所呈数据集上提供基准基线性能,我们适配了多种机器学习(支持向量机、逻辑回归、朴素贝叶斯)、深度学习(卷积神经网络、循环神经网络)与混合方法。通过使用分别 7 种与 5 种不同的特征表示方法,比较基于机器与深度学习方法的性能,评估了所生成神经词嵌入的有效性。最后,提出一种新颖的精确极端多通道混合方法,其在 F1-score 上分别以 9% 与 4% 优于最先进的适配机器学习与深度学习方法。罗马乌尔都语情感分析,罗马乌尔都语预训练词嵌入,Word2Vec,Glove,Fast-Text

关键词

引用

@article{arxiv.2003.05443,
  title  = {A Precisely Xtreme-Multi Channel Hybrid Approach For Roman Urdu Sentiment Analysis},
  author = {Faiza Memood and Muhammad Usman Ghani and Muhammad Ali Ibrahim and Rehab Shehzadi and Muhammad Nabeel Asim},
  journal= {arXiv preprint arXiv:2003.05443},
  year   = {2020}
}