非负矩阵分解与 n 级潜在狄利克雷分配在土耳其语推文情感分析中的评估
计算与语言
2021-10-04 v1 信息检索
机器学习
摘要
随着技术的发展,社交媒体的使用已变得相当普遍。在当今时代,对媒体与广告等领域中社交媒体上的评论进行分析发挥着重要作用。为此,新的与传统自然语言处理方法被用于检测这些分享内容的情感。本文中,采用主题建模中的潜在狄利克雷分配(即 LDA)与非负矩阵分解方法,以确定经由 Twitter 发布的土耳其语推文属于何种情感。此外,分析了所提出的基于 LDA 的 n 级方法的准确性。数据集由愤怒、恐惧、快乐、悲伤与困惑 5 种情感构成。在本研究所有主题建模方法中,NMF 是最为成功的方法。随后,利用各主题的词权重与类标签获得适用于 Weka 的文件,据此分析了 Random Forest、Naive Bayes 与 Support Vector Machine 方法的 F1 度量。在 Weka 结果中,最成功的方法为 n 级 LDA,最成功的算法为 Random Forest。
引用
@article{arxiv.2110.00418,
title = {Evaluation of Non-Negative Matrix Factorization and n-stage Latent Dirichlet Allocation for Emotion Analysis in Turkish Tweets},
author = {Zekeriya Anil Guven and Banu Diri and Tolgahan Cakaloglu},
journal= {arXiv preprint arXiv:2110.00418},
year = {2021}
}
备注
Published in: 2019 Innovations in Intelligent Systems and Applications Conference (ASYU). This paper is extension version of Comparison Method for Emotion Detection of Twitter Users (http://dx.doi.org/10.1109/ASYU48272.2019.8946435). Please citation this IEEE paper