中文

ProvX:为基于来源的检测生成反事实驱动的攻击解释

密码学与安全 2025-08-11 v1

摘要

基于来源图的入侵检测系统部署在主机上,以防御日益严重的高级持续性威胁。使用图神经网络检测这些威胁已成为研究焦点,并展示了卓越的性能。然而,基于 GNN 的安全模型的广泛采用受到其固有黑箱性质的限制,因为它们无法为安全分析师提供任何可验证的模型预测解释,也无法提供任何关于模型判断与真实世界攻击关联的证据。为了应对这一挑战,我们提出了 ProvX,这是一个有效的解释框架,用于解释来源图上的基于 GNN 的安全模型。ProvX 引入了反事实解释逻辑,在被预测为恶意的图中寻找最小的结构子集,当该子集被扰动时,能够颠覆模型的原始预测。我们创新性地将寻找这一关键子图的离散搜索问题转化为一个由预测翻转和距离最小化双重目标引导的连续优化任务。此外,还结合了分阶段固化策略,以提高解释的精确性和稳定性。我们在权威数据集上对 ProvX 进行了广泛评估。实验结果表明,ProvX 能够定位与真实世界攻击高度相关的关键图结构,并实现了 51.59% 的平均解释必要性,这些指标优于当前的 SOTA 解释器。此外,我们探索并初步验证了一个闭环的“检测-解释-反馈”增强框架,通过实验证明 ProvX 的解释结果可以指导模型优化,有效增强其对抗对抗性攻击的鲁棒性。

关键词

引用

@article{arxiv.2508.06073,
  title  = {ProvX: Generating Counterfactual-Driven Attack Explanations for Provenance-Based Detection},
  author = {Weiheng Wu and Wei Qiao and Teng Li and Yebo Feng and Zhuo Ma and Jianfeng Ma and Yang Liu},
  journal= {arXiv preprint arXiv:2508.06073},
  year   = {2025}
}