EUREKHA:增强地下论坛关键黑客识别的用户表示
密码学与安全
2024-11-11 v1 计算与语言
社会与信息网络
摘要
地下论坛作为网络空间中网络犯罪活动的中心,为匿名性和规避常规在线监管提供了空间。在这些隐藏社区中,恶意行为者协作,交换非法知识、工具和战术,从而驱动从黑客技术到盗取数据、恶意软件和零日漏洞销售的各种网络威胁。识别背后策划者(即关键黑客)的行为对于理解这些运营至关重要,但仍是复杂的挑战。本文提出了一种新方法,称为 EUREKHA(Enhancing User Representation for Key Hacker Identification in Underground Forums),用于识别这些关键黑客。该方法将每个用户建模为文本序列,通过大型语言模型 (LLM) 进行领域特定适应,LLM 充当特征提取器。提取的特征随后输入图神经网络 (GNN) 以建模用户结构关系,从而显著提高识别准确度。此外,我们采用 BERTopic(Bidirectional Encoder Representations from Transformers Topic Modeling)从用户生成内容中提取个人化主题,实现每个用户多个文本表示,从而优化最具代表性的序列选择。我们的研究表明,微调后的 LLM 在识别关键黑客方面优于现有最先进的方法。此外,结合 GNN 使用后,我们的模型在准确度和 F1 分数上分别实现了约 6% 和 10% 的显著提升。EUREKHA 在 Hack-Forums 数据集上进行测试,我们提供了开源代码以供公开使用。
引用
@article{arxiv.2411.05479,
title = {EUREKHA: Enhancing User Representation for Key Hackers Identification in Underground Forums},
author = {Abdoul Nasser Hassane Amadou and Anas Motii and Saida Elouardi and EL Houcine Bergou},
journal= {arXiv preprint arXiv:2411.05479},
year = {2024}
}
备注
Accepted at IEEE Trustcom 2024