中文

AISA:唤醒大语言模型针对越狱攻击的内在安全意识

密码学与安全 2026-02-17 v1 人工智能

摘要

大语言模型(LLM)仍 vulnerable to jailbreak prompts,即能诱导模型产生有害或违反政策的输出,而许多现有防御措施依赖高昂的微调、侵入性的提示重写,或外部监控系统,增加延迟且可能降低帮助fulness。我们提出AISA,一种轻量级、单次通过的防御机制,通过激活模型内部潜在的安全行为,而非将安全视为附加功能。AISA 首先通过时空分析定位内在安全意识,发现意图判别信号广泛编码,尤其在生成最终结构标记前的特定注意力头中表现出强大的可分离性。利用一组自动选取的注意力头,AISA 从中提取可解释的提示风险评分,开销最小,在7B 小模型上实现与强大专有基线相当的检测器性能。AISA 然后进行 logits 级引导:根据推断风险对解码分布进行调制,从 benign 提示下的正常生成,到 high-risk 请求下的校准拒绝,不改变模型参数、添加辅助模块,或需要多次推理。广泛实验覆盖13个数据集、12个 LLM 和14个基线,表明AISA 在保持实用性和降低误拒率的同时,提升了鲁棒性和迁移性能,即使针对弱对齐或故意高风险的模型变体也能实现更安全的部署。

关键词

引用

@article{arxiv.2602.13547,
  title  = {AISA: Awakening Intrinsic Safety Awareness in Large Language Models against Jailbreak Attacks},
  author = {Weiming Song and Xuan Xie and Ruiping Yin},
  journal= {arXiv preprint arXiv:2602.13547},
  year   = {2026}
}