中文

基于乌尔都语语音与文本的 sentiment 分析器

计算与语言 2022-07-20 v1

摘要

发现他人想法一直是我们信息收集策略的关键方面。随着在线评论网站和个人博客等富含观点资源的可用性与普及度提升,人们现在可主动利用信息技术寻找并理解他人想法。由于其在对人们观点理解中的关键作用,情感分析(SA)是一项重要任务。然而,现有研究主要聚焦于英语,仅有少量研究致力于低资源语言。针对情感分析,本工作基于用户评价提出一个新的多类乌尔都语数据集。乌尔都语数据集取自 Twitter 网站。我们提出的数据集包含 10,000 条评论,由人类专家仔细分类为两类:正面、负面。本研究主要目的是构建用于乌尔都语情感分析的手动标注数据集并建立基线结果。采用了五种基于词典与规则的不同算法,包括 Naivebayes、Stanza、Textblob、Vader 和 Flair,实验结果显示 Flair 以 70% 准确率优于其他被测算法。

关键词

引用

@article{arxiv.2207.09163,
  title  = {Urdu Speech and Text Based Sentiment Analyzer},
  author = {Waqar Ahmad and Maryam Edalati},
  journal= {arXiv preprint arXiv:2207.09163},
  year   = {2022}
}

备注

Sentiment Analysis, Opinion Mining, Urdu language, polarity assessment, lexicon-based method