代码混合社交媒体文本(Hinglish)的情感分析
计算与语言
2021-02-25 v1
摘要
本文讨论了将不同技术应用于以 Hinglish 书写的社交媒体(Twitter)代码混合文本情感分析所获得的结果。执行情感分析涉及的各阶段为数据整合、数据清洗、数据转换与建模。应用了多种数据清洗技术,数据经五轮迭代清洗,并在每轮迭代后记录实验结果。数据使用 count vectorizer、one hot vectorizer、tf-idf vectorizer、doc2vec、word2vec 与 fasttext 嵌入进行转换。模型使用 SVM、KNN、决策树、随机森林、朴素贝叶斯、逻辑回归与集成投票分类器等多种机器学习算法构建。数据取自 Codalab 竞赛网站的一项任务,该任务列于 Semeval-2020 竞赛网站的 Task:9。所建模型使用 F1-score (macro) 评估。使用集成投票分类器取得了 69.07 的最佳 F1-score。
引用
@article{arxiv.2102.12149,
title = {Sentiment Analysis of Code-Mixed Social Media Text (Hinglish)},
author = {Gaurav Singh},
journal= {arXiv preprint arXiv:2102.12149},
year = {2021}
}
备注
17 pages, 12 figures, 12 tables