中文

嵌入投毒:通过嵌入语义偏移绕过安全对齐机制

密码学与安全 2025-09-09 v1 机器学习

摘要

通过平台如 Hugging Face 等公开平台分发的大语言模型(LLM)带来了显著的安全挑战。虽然这些平台会执行基本的安全扫描,但往往未能检测嵌入层内部的微妙操纵。本工作识别了一种新型部署阶段攻击,利用这一漏洞,通过在嵌入层输出中注入不可察觉的扰动而不修改模型权重或输入文本。这些扰动虽在统计上是良性的,却系统性地绕过安全对齐机制,诱导模型在推理期间产生有害行为。我们提出了基于搜索的嵌入投毒(Search based Embedding Poisoning, SEP),这是一种实用的、对模型agnostic 的框架,通过对与高风险 token 相关的嵌入引入精心优化的扰动。SEP 利用模型响应中从拒绝到有害输出、再到语义偏移的可预测线性过渡,识别能够规避对齐安全措施的狭窄扰动窗口。评估表明,SEP 在六个对齐 LLM 上实现了平均 96.43% 的攻击成功率,同时保持良好的任务性能,能规避常规检测机制。我们的发现揭示了部署安全中的一个关键疏漏,强调在未来的 LLM 防御策略中亟需在嵌入层进行完整性检查。

关键词

引用

@article{arxiv.2509.06338,
  title  = {Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift},
  author = {Shuai Yuan and Zhibo Zhang and Yuxi Li and Guangdong Bai and Wang Kailong},
  journal= {arXiv preprint arXiv:2509.06338},
  year   = {2025}
}

备注

16 pages,9 figures