中文

深入剖析:LLM漏洞检测的电路级分析

密码学与安全 2026-05-29 v1 机器学习

摘要

大型语言模型(LLM)可以检测软件漏洞,但它们如何实际识别脆弱代码呢?我们使用机制解释学;分析神经网络的内部计算以理解其推理过程。使用Circuit Tracer对Gemma-2-2b进行分析,当模型对472个C/C++代码样本进行脆弱或安全分类时,我们追踪了激活的计算路径。我们的分析揭示了一项令人惊讶的发现:模型主要依赖安全探测器,即识别安全编码模式的注意力头,而不是直接检测漏洞特征。当这些安全探测器未激活时,模型会将代码分类为脆弱。我们识别了关键神经组件:位于前层(L5, L7)的特定注意力头专注于安全模式,位于第7层的多层感知器(MLP)神经元编码与漏洞相关的特征。消除实验确认了它们的因果作用;移除第11层会将漏洞检测准确率从100%降至6%,而仅消除第7层的20个神经元也会使其降低50%。我们的发现表明,LLM漏洞检测使用稀疏、可解释的电路(仅占模型容量的16%),为安全预测提供电路级解释,并实现针对性的检测系统改进。

关键词

引用

@article{arxiv.2605.29901,
  title  = {Dissecting the Black Box: Circuit-Level Analysis of LLM Vulnerability Detection},
  author = {Syafiq Al Atiiq and Chun Zhou and Christian Gehrmann},
  journal= {arXiv preprint arXiv:2605.29901},
  year   = {2026}
}

备注

11 pages, 6 figures. Supported by the Wallenberg AI, Autonomous Systems and Software Program (WASP)