中文

SynthCTI:基于 LLM 的合成 CTI 生成以增强 MITRE 技术映射

密码学与安全 2025-07-24 v1 人工智能 机器学习

摘要

网络威胁情报(CTI)挖掘涉及从非结构化威胁数据中提取结构化见解,使组织能够理解并应对不断演变的对手行为。CTI 挖掘中的一项关键任务是将威胁描述映射到 MITRE ATT&CK 技术。然而,这一过程通常由人工完成,需要专家知识和大量精力。自动化方法面临两大主要挑战:高质量标注 CTI 数据的稀缺,以及类别不平衡(许多技术的示例极少)。虽然 SecureBERT 等特定领域的大型语言模型(LLM)已展现出性能提升,但最近的大多数工作集中在模型架构上,而非解决数据局限性。在本工作中,我们提出了 SynthCTI,这是一种数据增强框架,旨在为代表性不足的 MITRE ATT&CK 技术生成高质量的合成 CTI 句子。我们的方法使用基于聚类的策略从训练数据中提取语义上下文,并指导 LLM 生成在词汇上多样且语义上忠实的合成 CTI 句子。我们在两个公开可用的 CTI 数据集 CTI-to-MITRE 和 TRAM 上评估了 SynthCTI,使用了不同容量的 LLM。纳入合成数据带来了持续的 macro-F1 提升:例如,ALBERT 从 0.35 提升至 0.52(相对提升 48.6%),SecureBERT 达到 0.6558(从 0.4412 起步)。值得注意的是,使用 SynthCTI 增强后的较小模型优于未经增强训练的较大模型,这证明了数据生成方法对于构建高效且有效的 CTI 分类系统的价值。

关键词

引用

@article{arxiv.2507.16852,
  title  = {SynthCTI: LLM-Driven Synthetic CTI Generation to enhance MITRE Technique Mapping},
  author = {Álvaro Ruiz-Ródenas and Jaime Pujante Sáez and Daniel García-Algora and Mario Rodríguez Béjar and Jorge Blasco and José Luis Hernández-Ramos},
  journal= {arXiv preprint arXiv:2507.16852},
  year   = {2025}
}

备注

17 pages, 13 figures