中文

针对网络犯罪情报文本的对抗技术注释的层次化检索增强生成

计算与语言 2026-04-17 v1

摘要

将网络犯罪情报(CTI)文本映射到MITRE ATT\&CK 技能 ID 是理解对手行为并自动化威胁防御的关键任务。虽然最近的检索增强生成(RAG)方法在该领域展示了有前景的能力,但它们根本依赖平坦检索范式。通过将所有技术统一对待,这些方法忽略了ATT\&CK框架中技术在结构上组织为高层次战术下的内在分类。本文我们提出H-TechniqueRAG,一个新的层次化RAG框架,将该战术-技术分类注入为强大的归纳偏置,以实现高度高效和准确的注释。我们的ethods引入了两阶段层次化检索机制:首先识别宏观层次的战术(对手的技术目标),随后将搜索范围限定在这些战术内的技术,从而有效减少候选搜索空间77.5%。为进一步弥合检索与生成之间的差距,我们设计了战术感知reranking模块和层次结构受限的上下文组织策略,以缓解LLM上下文过载并提高推理精度。全面实验在三个多样化CTI数据集上表明,H-TechniqueRAG不仅在F1分数上超过最新技术RAG的3.8%,还实现了62.4%的推理延迟降低和60%的LLM API调用减少。进一步分析表明,我们的层次结构先验为模型提供了更好的跨域泛化能力,并为安全分析师提供了高度可解释的分步决策路径。

关键词

引用

@article{arxiv.2604.14166,
  title  = {Hierarchical Retrieval Augmented Generation for Adversarial Technique Annotation in Cyber Threat Intelligence Text},
  author = {Filippo Morbiato and Markus Keller and Priya Nair and Luca Romano},
  journal= {arXiv preprint arXiv:2604.14166},
  year   = {2026}
}