SoK:大语言模型安全性的全面因果分析框架
密码学与安全
2025-12-05 v1 人工智能
摘要
大语言模型(LLMs)展现出卓越能力,但仍然容易受到对抗性操控,如越狱攻击——通过精心设计的提示绕过安全机制。理解此类漏洞的因果因素对于构建可靠的防御至关重要。在本工作中,我们提出一个统一的因果分析框架,系统性地支持LLM中所有层级的因果研究,从词元级、神经元级、层级干预到表示级分析。该框架支持在不同因果驱动的攻击与防御方法之间进行一致的实验和比较。伴随该实现,我们提供了首个因果驱动越狱研究的全面调查,并在多个开源权重模型和安全性关键基准上对该框架进行了实证评估,评估内容包括越狱攻击、幻觉检测、后门识别和公平性评估。我们的结果表明:(1)对因果关键成分的定向干预可以可靠地改变安全行为;(2)与安全相关的机制高度局部化(即集中在早期至中期层,仅约1–2%的神经元表现出因果影响);(3)从我们框架中提取的因果特征在多种威胁类型上实现了超过95%的检测准确率。通过桥接理论因果分析与实际模型安全性,我们的框架为基于因果的攻击、可解释性以及鲁棒攻击检测与缓解研究建立了可复现的基础。代码可在https://github.com/Amadeuszhao/SOK_Casuality获取。
引用
@article{arxiv.2512.04841,
title = {SoK: a Comprehensive Causality Analysis Framework for Large Language Model Security},
author = {Wei Zhao and Zhe Li and Jun Sun},
journal= {arXiv preprint arXiv:2512.04841},
year = {2025}
}