CTIArena:面向异构网络威胁情报的 LLM 知识与推理基准
密码学与安全
2025-10-15 v1 人工智能
摘要
网络威胁情报(CTI)是现代网络安全的核心,为检测和缓解不断演变的威胁提供关键洞察。随着大语言模型(LLM)在自然语言理解与推理方面的能力提升,越来越多地将其应用于 CTI,这需要能够严格评估其性能的基准测试。已有一些早期工作在 CTI 任务上研究了 LLM,但仍存在不足:(i)仅采用封闭式书籍设置,依赖参数化知识而不利用 CTI 知识库;(ii)覆盖的任务集合有限,缺乏对 CTI 生态系统的系统性把握;(iii)评估仅限于单源分析,与需要在多个来源之间进行推理的真实场景不同。为填补这些差距,我们提出 CTIArena,这是第一个用于评估在异构、多源 CTI 环境下、在知识增强设置下 LLM 性能的基准。CTIArena 涵盖三个类别,分别为结构化、非结构化和混合,进一步细分为九个任务,覆盖现代安全运营中 CTI 分析的广泛范围。我们评估了十个广泛使用的 LLM,发现大多数在封闭式书籍环境中表现不佳,但在通过我们设计的检索增强技术将安全相关知识注入后,能够显著提升。这些发现凸显了通用 LLM 的局限性,以及针对 CTI 需要定制化技术以充分发挥其潜力的必要性。
引用
@article{arxiv.2510.11974,
title = {CTIArena: Benchmarking LLM Knowledge and Reasoning Across Heterogeneous Cyber Threat Intelligence},
author = {Yutong Cheng and Yang Liu and Changze Li and Dawn Song and Peng Gao},
journal= {arXiv preprint arXiv:2510.11974},
year = {2025}
}
备注
Under peer-review