使用端到端、迁移学习、分布式及可解释 AI 模型对文本与 Emoji 数据进行情感分析的性能评估
计算与语言
2025-02-20 v1 人工智能
摘要
在当今的数字世界中,Emoji 被频繁使用以表达从简单到复杂的想法,其使用频率前所未有。因此,它们也被用于情感分析和定向营销活动。在本研究中,我们对 Tweets 以及来自 Kaggle 的 emoji 数据集进行了情感分析。由于推文是句子,我们使用了 Universal Sentence Encoder (USE) 和 Sentence Bidirectional Encoder Representations from Transformers (SBERT) 端到端句子嵌入模型来生成嵌入,并用其训练标准的全连接神经网络(NN)和 LSTM NN 模型。我们观察到,这两个模型的文本分类准确率几乎相同,均在 98% 左右。相反,当使用训练集中未出现的 emoji 构建验证集时,两个模型的准确率都急剧下降至 70%。此外,模型还采用了分布式训练方法而非传统的单线程模型进行训练,以获得更好的可扩展性。使用分布式训练方法,我们能够在不妥协准确率的情况下将运行时间减少约 15%。最后,作为可解释 AI 的一部分,我们使用 Shap 算法解释了模型行为,并检查了给定特征集的模型偏差。
引用
@article{arxiv.2502.13278,
title = {Performance Evaluation of Sentiment Analysis on Text and Emoji Data Using End-to-End, Transfer Learning, Distributed and Explainable AI Models},
author = {Sirisha Velampalli and Chandrashekar Muniyappa and Ashutosh Saxena},
journal= {arXiv preprint arXiv:2502.13278},
year = {2025}
}