中文

代码混合社交媒体文本(Hinglish)的情感分析

计算与语言 2021-02-25 v1

摘要

本文讨论了将不同技术应用于以 Hinglish 书写的社交媒体(Twitter)代码混合文本情感分析所获得的结果。执行情感分析涉及的各阶段为数据整合、数据清洗、数据转换与建模。应用了多种数据清洗技术,数据经五轮迭代清洗,并在每轮迭代后记录实验结果。数据使用 count vectorizer、one hot vectorizer、tf-idf vectorizer、doc2vec、word2vec 与 fasttext 嵌入进行转换。模型使用 SVM、KNN、决策树、随机森林、朴素贝叶斯、逻辑回归与集成投票分类器等多种机器学习算法构建。数据取自 Codalab 竞赛网站的一项任务,该任务列于 Semeval-2020 竞赛网站的 Task:9。所建模型使用 F1-score (macro) 评估。使用集成投票分类器取得了 69.07 的最佳 F1-score。

关键词

引用

@article{arxiv.2102.12149,
  title  = {Sentiment Analysis of Code-Mixed Social Media Text (Hinglish)},
  author = {Gaurav Singh},
  journal= {arXiv preprint arXiv:2102.12149},
  year   = {2021}
}

备注

17 pages, 12 figures, 12 tables