中文

使用监督机器学习识别暗网恶意帖子

密码学与安全 2025-12-01 v1 人工智能

摘要

鉴于网络攻击的持续增长和日益复杂化,网络安全已不能仅依赖传统的防御技术和工具。主动检测网络威胁变得至关重要,以帮助安全团队识别潜在风险并实施有效的缓解措施。网络威胁情报(CTI)在其中扮演关键角色,通过提供基于证据的网络威胁知识来帮助安全分析师。CTI 信息可通过各种技术和数据源提取;然而,机器学习方法已被证明具有前景。就数据源而言,社交网络和在线讨论论坛是常见的探索对象。在本研究中,我们对来自巴西葡萄牙语暗网论坛收集的数据应用文本挖掘技术和机器学习,以识别恶意帖子。我们的贡献包括创建三个原始数据集、一种新颖的多阶段标注过程,将威胁指示器(IoCs)、上下文关键词和人工分析相结合,以及对文本表示和分类器的全面评估。鉴于本研究是首次专注于巴西葡萄牙语内容,我们对其进行了彻底的研究。最佳表现模型使用 LightGBM 和 TF-IDF 能够以高准确率检测相关帖子。我们还对模型输出应用于无标签数据进行主题建模,以确认其在现实场景中的鲁棒性。

关键词

引用

@article{arxiv.2511.23183,
  title  = {Identification of Malicious Posts on the Dark Web Using Supervised Machine Learning},
  author = {Sebastião Alves de Jesus Filho and Gustavo Di Giovanni Bernardo and Paulo Henrique Ribeiro Gabriel and Bruno Bogaz Zarpelão and Rodrigo Sanches Miani},
  journal= {arXiv preprint arXiv:2511.23183},
  year   = {2025}
}

备注

Manuscript under review (SN Computer Science)