基于深度学习的社交媒体攻击性评论分类:机器翻译数据 vs 真实数据
计算机视觉与模式识别
2023-03-15 v1
摘要
社交媒体上的攻击性评论对人类生活产生负面影响。此类冒犯性内容是导致抑郁与自杀相关活动的因素。由于在线社交网络日益增多,仇恨内容也在增加。已有若干关于网络欺凌、网络攻击、仇恨言论等领域的研究。大多数探究以英语进行。一些语言(印地语和孟加拉语)由于缺乏数据集仍缺乏适当研究。本文特别针对印地语、孟加拉语和英语数据集来检测攻击性评论,并展示了一种生成机器翻译数据以解决数据缺失问题的新方法。我们使用长短期记忆模型(LSTM)、双向长短期记忆模型(BiLSTM)、LSTM-自编码器、word2vec、来自 Transformers 的双向编码器表示(BERT)和生成式预训练 Transformer(GPT-2)等模型,对完全机器翻译的英语数据集进行分析,以观察模型在含噪声的机器翻译数据集上的表现。我们将使用噪声数据的性能与另外两种数据集进行比较:不含任何噪声的原始数据,以及含有一定量噪声的半噪声数据。我们使用上述模型对原始数据和半噪声数据均进行了分类。为评估模型性能,我们采用了 F1-score、准确率、精确率和召回率等评价指标。我们在原始数据上用 gpt2 模型取得了最高准确率,在半噪声数据上用 BERT 模型,在完全机器翻译数据上用 BERT 模型。由于许多语言缺乏适当的数据可用性,我们的方法将帮助研究者创建机器翻译数据集以用于多种分析目的。
引用
@article{arxiv.2303.07484,
title = {Deep Learning Approach for Classifying the Aggressive Comments on Social Media: Machine Translated Data Vs Real Life Data},
author = {Mst Shapna Akter and Hossain Shahriar and Nova Ahmed and Alfredo Cuzzocrea},
journal= {arXiv preprint arXiv:2303.07484},
year = {2023}
}