探测大型语言模型安全性对隐层扰动的鲁棒性
机器学习
2025-06-23 v1 人工智能
计算与语言
密码学与安全
摘要
安全对齐是构建可靠人工通用智能(AGI)的关键要求。尽管安全对齐取得了显著进展,我们观察到即使是小的隐层扰动仍可触发对齐模型中的不安全响应。我们认为这源于现有对齐方法的浅层特性——这些方法关注表层级的拒绝行为,而不足以改变内部表示。Consequently,small shifts in hidden activations can re-trigger harmful behaviors embedded in the latent space. 为探索安全对齐对隐层扰动的鲁棒性,我们引入一种探针方法,用于衡量模型生成原始响应的负对数似然(Negative Log-Likelihood)。该探针衡量了潜在空间中的局部灵敏度,作为诊断工具用于识别脆弱方向。基于此信号,我们构建了有效的 jailbreak 轨迹,形成 Activation Steering Attack(ASA)。更重要的是,这些见解为改进对齐鲁棒性提供了原则性基础。为此,我们引入 Layer-wise Adversarial Patch Training(LAPT),这是一种 fine-tuning 策略,在训练期间将受控扰动注入隐藏表示。实验结果表明,LAPT 在不损害通用能力的前提下增强了对齐鲁棒性。我们的发现揭示了当前对齐范式中的根本性缺陷,呼吁超越表面级行为监督的表示级别训练策略。代码和结果已在 https://github.com/Carol-gutianle/LatentSafety 中提供。
引用
@article{arxiv.2506.16078,
title = {Probing the Robustness of Large Language Models Safety to Latent Perturbations},
author = {Tianle Gu and Kexin Huang and Zongqi Wang and Yixu Wang and Jie Li and Yuanqi Yao and Yang Yao and Yujiu Yang and Yan Teng and Yingchun Wang},
journal= {arXiv preprint arXiv:2506.16078},
year = {2025}
}