面向蓝队威胁狩猎的具身环境 LLM 基准测试
密码学与安全
2025-05-20 v1
摘要
随着网络威胁规模和复杂性不断增长,蓝队防御者越来越需要先进工具来主动检测和缓解风险。大型语言模型(LLM)为增强威胁分析提供了前景的能力。然而,其在现实世界蓝队威胁狩猎场景中的效果尚未得到充分探索。本文提出了 CYBERTEAM,一个旨在指导 LLM 实践蓝队操作的基准测试。CYBERTEAM 以两个阶段构建具身环境。首先,捕获从威胁归因到事件响应中分析任务之间的依赖关系,以建模真实的威胁狩猎工作流程。接下来,针对每个任务通过一组针对其特定分析需求的具身函数进行处理。这将整个威胁狩猎过程转化为由函数驱动的结构化操作序列,其中每个节点代表一个离散函数,边缘定义执行顺序。通过该框架指导,LLM 被引导通过模块化步骤执行威胁狩猎任务。总体而言,CYBERTEAM 集成了 30 个任务和 9 个具身函数,指导 LLM 进行流水线威胁分析。我们评估了领先的 LLM 和最新网络安全智能体,比较了 CYBERTEAM 的具身函数调用与基本的elicitation策略。我们的结果为了解 LLM 在威胁狩猎中的当前能力与局限性提供了宝贵见解,为实际应用奠定了基础。
引用
@article{arxiv.2505.11901,
title = {Benchmarking LLMs in an Embodied Environment for Blue Team Threat Hunting},
author = {Xiaoqun Liu and Feiyang Yu and Xi Li and Guanhua Yan and Ping Yang and Zhaohan Xi},
journal= {arXiv preprint arXiv:2505.11901},
year = {2025}
}