通过嵌入空间毒性消 attenuation 规避大语言模型的安全对齐机制
计算与语言
2025-07-14 v1 人工智能
摘要
大语言模型 (LLM) 在医疗、教育和网络安全等诸多领域取得了显著进展。然而,这种开放性也带来了显著的安全风险,尤其是通过嵌入空间毒性投毒,这是一种潜在的细微攻击手段,攻击者通过操控输入数据在内部语义表示中的嵌入来绕过安全对齐机制。虽然先前研究探索了通用扰动方法,但 LLM 安全对齐在嵌入层面的动态机制仍不充分理解。因此,更具针对性和精准性的对抗性扰动技术尚未得到充分研究。在本工作中,我们提出了 ETTA(Embedding Transformation Toxicity Attenuation),一种新型框架,通过线性变换识别并消除嵌入空间中对毒性敏感的维度。ETTA 在无需模型微调或访问训练数据的情况下,能够规避模型拒绝行为,同时保持语言连贯性。我们在五个代表性开源 LLM 上评估了 ETTA,基于 AdvBench 框架,其平均攻击成功率为 88.61%,优于最佳基线 11.34%,并能针对安全强化模型(如在指令调优防御模型上实现 77.39% 的 ASR)实现概括。这些结果凸显了当前对齐策略中的关键漏洞,强调仍需考虑嵌入层面的防御措施。
关键词
引用
@article{arxiv.2507.08020,
title = {Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation},
author = {Zhibo Zhang and Yuxi Li and Kailong Wang and Shuai Yuan and Ling Shi and Haoyu Wang},
journal= {arXiv preprint arXiv:2507.08020},
year = {2025}
}