中文

基于大语言模型的源头追溯 Forensic 技术:威胁调查与检测

密码学与安全 2025-11-18 v2

摘要

我们提出PROVSEEK,一个由大语言模型驱动的智能体框架,用于自动化源头追溯驱动的 Forensic 分析和威胁情报提取。PROVSEEK采用专用工具链,通过生成精确的、具有上下文感知的查询,将威胁报告中的知识与系统源头追溯数据中的证据相融合。该框架解决源头追溯查询,协调多个角色特定智能体,并合成结构化、可核查的 Forensic 摘要。通过将智能体编排与检索增强生成(RAG)和链式思考(CoT)推理相结合,结合基于行为模型的数据导向过滤,PROVSEEK实现适应性的多步骤分析,不断细化假设,验证支撑证据,产生可扩展且可解释的攻击行为 Forensic 解释。PROVSEEK旨在无需任务特定训练数据的情况下实现自动威胁调查,即使在没有环境先验知识的情况下也能进行 Forensic 风格的调查。我们在公开可用的DARPA数据集上进行了全面评估,结果表明,PROVSEEK在情报提取任务中优于检索基方法,实现上下文精确度/召回率提升34%;在威胁检测任务中,PROVSEEK相较于基线智能体方法和最先进(SOTA)基于源头追溯的入侵检测系统(PIDS),实现精确率/召回率分别提升22%/29%。在可扩展性研究中,我们展示了PROVSEEK在数据库规模扩大50倍时,token使用量增加1.42倍,延迟增加1.63倍,适合大规模部署。我们还进行了消融和错误分析研究,阐明了PROVSEEK的不同组件如何影响检测性能。

关键词

引用

@article{arxiv.2508.21323,
  title  = {LLM-driven Provenance Forensics for Threat Investigation and Detection},
  author = {Kunal Mukherjee and Murat Kantarcioglu},
  journal= {arXiv preprint arXiv:2508.21323},
  year   = {2025}
}