基于ML、DL和LLM的推特/X平台多语言网络威胁检测:比较分析
计算与语言
2025-12-09 v1 人工智能
摘要
网络威胁检测是当今数字时代的一个重要关注领域,由于社交媒体平台如Twitter(现为'X')上假信息和有害内容的传播不断增加,这类网络威胁常被隐藏在推文中,对个人、社区乃至国家构成重大风险,凸显了有效检测系统的必要性。尽管已有研究探索过基于推文的威胁检测,但大量工作受限于特定语言、特定领域或特定地点,或依赖单一模型,限制了其在多样化现实场景中的适用性。为此,本研究聚焦于多语言推特网络威胁检测,采用多种先进模型。研究分为三个阶段:(1)我们收集并在四种语言(英语、中文、俄语、阿拉伯语)上手动标注和基于极性的标注方法构建推特数据集,确保高质量标注;(2)分别对每个数据集应用机器学习(ML)和深度学习(DL)模型,评估其在不同语言上的表现;(3)将所有数据集合并为单个多语言数据集,应用DL和大语言模型(LLM)架构评估其在跨语言网络威胁识别中的效能。结果显示,在机器学习模型中,随机森林(Random Forest, RF)取得最佳表现;然而,Bi-LSTM架构在所有数据集上一致超越其他DL和LLM架构。这些发现凸显了Bi-LSTM在多语言网络威胁检测中的有效性。本论文的代码可在链接找到:https://github.com/Mmurrad/Tweet-Data-Classification.git。
引用
@article{arxiv.2502.04346,
title = {Multi-Lingual Cyber Threat Detection in Tweets/X Using ML, DL, and LLM: A Comparative Analysis},
author = {Saydul Akbar Murad and Ashim Dahal and Nick Rahimi},
journal= {arXiv preprint arXiv:2502.04346},
year = {2025}
}