SafeInt:通过安全感知表征干预遮蔽大语言模型免受越狱攻击
计算与语言
2025-05-26 v2
摘要
随着大型语言模型(LLM)在实际场景中的广泛部署,确保其行为符合安全标准已成为关键问题。越狱攻击利用 LLM 的漏洞诱导不期望的行为,构成对 LLM 安全的重大威胁。以往的防御方法往往难以同时实现有效性和效率。基于表征层面的防御提供了新思路,但现有干预无法根据查询的有害性动态调整表征。为此,我们提出了 SafeIntervention(SafeInt)——一种通过安全感知表征干预遮蔽 LLM 免受越狱攻击的新型防御方法。基于对越狱样本表征的分析,SafeInt 的核心思想是将与越狱相关的表征 relocate 到拒绝区域。通过干预越狱样本的表征分布,使其与不安全样本的表征分布对齐。我们 conducted comprehensive experiments 覆盖六种越狱攻击、两个越狱数据集和两个实用性基准。实验结果表明,SafeInt 在防御 LLM 免受越狱攻击方面优于所有基线方法,同时基本保持实用性。此外,我们评估了 SafeInt 对适应性攻击的效果,并验证了其在缓解实时攻击方面的有效性。
引用
@article{arxiv.2502.15594,
title = {SafeInt: Shielding Large Language Models from Jailbreak Attacks via Safety-Aware Representation Intervention},
author = {Jiaqi Wu and Chen Chen and Chunyan Hou and Xiaojie Yuan},
journal= {arXiv preprint arXiv:2502.15594},
year = {2025}
}