基于大语言模型与嵌入模型的技术识别与威胁行为者归因
密码学与安全
2025-05-20 v1 人工智能
计算机与社会
摘要
网络攻击的归因仍是网络防御者面临的复杂但关键挑战。当前,手动从密集的 forensic 文档中提取行为指示器会导致归因延迟显著,尤其是在涉及国际规模重大事件时。本研究评估了大语言模型(LLMs)在基于从 forensic 文档中提取的行为指示器进行网络攻击归因方面的效果。我们测试了 OpenAI 的 GPT-4 和 text-embedding-3-large,通过将 LLM 生成的技术、战术与程序(TTPs)与来自 MITRE ATT&CK 组织的人工生成数据进行比较。我们的框架随后利用向量嵌入搜索从文本中识别 TTPs,并构建配置文件,以便机器学习模型学习归因新型攻击。本研究的关键贡献包括:(1)评估即插即用大语言模型用于 TTP 提取与归因;(2)开发从原始 CTI 文档到威胁行为者预测的端到端流程。本研究发现,标准大语言模型生成的 TTP 数据集存在噪声,导致与人工生成数据集的相似度较低。然而,生成的 TTP 在频率上与现有 MITRE 数据集相似。此外,尽管这些 TTP 与人工生成数据集不同,我们的工作表明,它们仍然对在归因任务上超出基线水平的模型训练具有用处。项目代码与文件可在此处获取:https://github.com/kylag/ttp_attribution。
引用
@article{arxiv.2505.11547,
title = {On Technique Identification and Threat-Actor Attribution using LLMs and Embedding Models},
author = {Kyla Guru and Robert J. Moss and Mykel J. Kochenderfer},
journal= {arXiv preprint arXiv:2505.11547},
year = {2025}
}