中文

基于合成数据利用可信 LSTM-自编码器网络进行社交媒体网络欺凌检测

机器学习 2023-08-22 v1 计算与语言 社会与信息网络

摘要

社交媒体网络欺凌对人类生活有有害影响。随着在线社交网络日益发展,仇恨言论的数量也在增加。此类恶劣内容可导致抑郁及与自杀相关的行为。本文提出一种可信 LSTM-自编码器网络,利用合成数据进行社交媒体网络欺凌检测。我们展示了一种通过生成机器翻译数据来解决数据可用性难题的前沿方法。然而,由于数据集匮乏,印地语和孟加拉语等若干语言仍缺乏充分研究。我们使用所提模型及传统模型(包括长短期记忆(LSTM)、双向长短期记忆(BiLSTM)、LSTM-自编码器、Word2vec、来自变换器的双向编码器表示(BERT)和生成式预训练变换器 2(GPT-2)模型)在印地语、孟加拉语和英语数据集上实验识别攻击性评论。我们采用 f1-score、准确率、精确率和召回率等评估指标来评价模型性能。所提模型在所有数据集上优于所有模型,最高准确率达 95%。在我们的模型在本文所用数据集上的所有既往工作中取得了最先进的(SOTA)结果。

关键词

引用

@article{arxiv.2308.09722,
  title  = {A Trustable LSTM-Autoencoder Network for Cyberbullying Detection on Social Media Using Synthetic Data},
  author = {Mst Shapna Akter and Hossain Shahriar and Alfredo Cuzzocrea},
  journal= {arXiv preprint arXiv:2308.09722},
  year   = {2023}
}

备注

arXiv admin note: text overlap with arXiv:2303.07484