OCR-APT:基于子图异常检测与大语言模型的审计日志APT故事重建
摘要
高级持续性威胁(APT)是一类难以被系统级审计日志探测到的隐蔽网络攻击。源 provenance 图将这些日志建模为相互关联的实体与事件,从而揭示线性日志表示难以捕捉的关联关系。现有系统对此类图进行异常检测,但常面临高假阳性率和粗粒度警报的问题。其依赖节点属性(如文件路径或 IP 地址)的做法会导致虚假关联,降低检测的鲁棒性与可靠性。为了全面理解攻击的整体进程与影响,安全分析师需要能够生成准确、类似人类的攻击叙事的系统。为此,我们提出OCR-APT(Omit Content and Reconstruct APT Stories,APT内容遗忘与故事重建),一个用于APT检测与人类化攻击故事重建的系统。OCR-APT利用图神经网络(GNN)实现子图异常检测,通过学习节点周围的行为模式来进行检测,而非依赖诸如文件路径或 IP 地址等脆弱属性,从而提升检测的鲁棒性。随后,OCR-APT遍历检测到的子图,使用大语言模型(LLM)重建多阶段攻击故事。每一阶段均在继续之前进行验证,以减少幻觉并确保最终报告具有可解释性。我们在DARPA TC3、OpTC和NODLINK数据集上进行评估,结果表明OCR-APT在检测准确率和警报可解释性方面均优于当前最先进的系统。此外,OCR-APT能够重建人类化的报告,全面捕捉攻击的整个叙事。
引用
@article{arxiv.2510.15188,
title = {OCR-APT: Reconstructing APT Stories from Audit Logs using Subgraph Anomaly Detection and LLMs},
author = {Ahmed Aly and Essam Mansour and Amr Youssef},
journal= {arXiv preprint arXiv:2510.15188},
year = {2025}
}
备注
This is the authors' extended version of the paper accepted for publication at the ACM SIGSAC Conference on Computer and Communications Security (CCS 2025). The final published version is available at https://doi.org/10.1145/3719027.3765219