大语言模型认识其安全漏洞:通过自然分布迁移揭示安全缺口
计算与语言
2026-03-27 v3 人工智能
摘要
大语言模型(LLMs)因在预训练过程中暴露于potentially有害数据而引发安全关注。本文识别了一种新的安全漏洞:大语言模型对攻击提示与原始有害提示之间自然分布迁移的脆弱性,即看似良性的提示(与有害内容语义相关)可绕过安全机制。为探索此问题,本文引入一种新颖的攻击方法“ActorBreaker”,通过识别预训练分布中与有害提示相关的actor来构建渐进引导大语言模型暴露不安全内容的多轮提示。ActorBreaker基于拉托的actor网络理论,纳入人类与非人类actor,以捕捉更广泛的漏洞。实验结果表明,ActorBreaker在多种对齐大语言模型上在多样性、有效性和效率方面均优于现有攻击方法。为缓解此漏洞,本文提出需扩展安全训练以覆盖更广泛的有害内容语义空间。我们构建了使用ActorBreaker生成的多轮安全数据集。对模型进行微调后,在鲁棒性方面取得显著提升,尽管在实用性上存在一些权衡。代码已公开于 https://github.com/AI45Lab/ActorAttack。
引用
@article{arxiv.2410.10700,
title = {LLMs know their vulnerabilities: Uncover Safety Gaps through Natural Distribution Shifts},
author = {Qibing Ren and Hao Li and Dongrui Liu and Zhanxu Xie and Xiaoya Lu and Yu Qiao and Lei Sha and Junchi Yan and Lizhuang Ma and Jing Shao},
journal= {arXiv preprint arXiv:2410.10700},
year = {2026}
}
备注
ACL 2025 main conference. Code is available at https://github.com/AI45Lab/ActorAttack