一种用于增强 LLM 越狱攻击与防御的因果视角
机器学习
2026-02-06 v1 人工智能
密码学与安全
摘要
阐明大语言模型 (LLM) 中“越狱”机制对于增强其安全性和可靠性至关重要,但这些机制仍不完全为人所知。现有研究主要通过探测潜在表示来分析越狱提示,往往忽视了可解释提示特征与越狱发生之间的因果关系。在本工作中,我们提出了 Causal Analyst 框架,将 LLM 集成到数据驱动的因果发现中,以识别越狱的直接原因并利用这些原因进行攻击和防御。我们引入了包括 35k 条越狱尝试的综合数据集,涵盖 7 个 LLM,系统地来自 100 个攻击模板和 50 条有害查询,标注了 37 个精心设计的人类可读提示特征。通过联合训练 LLM 基于提示的编码和基于图神经网络的因果图学习,我们重构了将提示特征与越狱响应关联起来的因果路径。我们的分析揭示了诸如“积极角色”和“任务步骤数量”等特定特征是越狱的直接因果驱动因素。我们通过两种实际应用演示了这些见解的实用性:(1) 一个越狱增强器,针对所识别的因果特征显著提升公共基准测试上的攻击成功率;(2) 一个警卫顾问,利用所学因果图从混淆查询中提取出真实的恶意意图。广泛的实验,包括基线比较和因果结构验证,确认了我们因果分析的稳健性以及其相对于非因果方法的优势。我们的结果表明,从因果视角分析越狱特征是提高 LLM 可靠性的有效且可解释的方法。我们的代码可在 https://github.com/Master-PLC/Causal-Analyst 获取。
引用
@article{arxiv.2602.04893,
title = {A Causal Perspective for Enhancing Jailbreak Attack and Defense},
author = {Licheng Pan and Yunsheng Lu and Jiexi Liu and Jialing Tao and Haozhe Feng and Hui Xue and Zhixuan Chu and Kui Ren},
journal= {arXiv preprint arXiv:2602.04893},
year = {2026}
}