中文

基于前缀探测的数据安全意图防御

密码学与安全 2026-05-12 v2 人工智能

摘要

大型语言模型 (LLM) 仍然 vulnerable to 越狱攻击, adversarially crafted 提示会导致违反政策的响应,尽管已进行安全对齐。现有的防御通常通过外部过滤、辅助警戒或解码时控制来提高安全性。然而,这些干预措施常常会降低实际部署可行性,因为它们可能需要额外的模型访问、引入额外的推理成本,或影响善用途的实用性。在本文中,我们提出了安全意图防御 (SAID),这是一种基于意图级别安全探测的训练免费越狱防御框架。SAID 首先通过目标模型本身将可能被掩盖的用户输入蒸馏为简洁的核心意图。然后,它对每个蒸馏后的意图应用经过验证的安全前缀进行探测,以触发模型的安全感知响应。最后,采用保守的聚合规则,如果识别出任何蒸馿后的意图不安全,则拒绝原始请求。这种设计使防御能够与黑箱兼容,而无需更新模型参数或修改解码过程。在六个代表性越狱攻击下的四个开源 LLM 实验中,SAID 在减少有害响应方面实现了提升的防御性能,同时在善用途任务上保持有竞争力的实用性。进一步的对前缀变体、层次化蒸馿和推理效率的分析表明,SAID 为确保 LLM 免受越狱威胁提供了实用的安全-实用性权衡。

关键词

引用

@article{arxiv.2510.20129,
  title  = {SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models},
  author = {Yulong Chen and Qi Zhang and Jiawen Zhang and Yadong Liu and Mu Li and Jie Wen and Yong Xu},
  journal= {arXiv preprint arXiv:2510.20129},
  year   = {2026}
}

备注

12 pages, 5 figures. V2: Updated title, author list, and extensive experiments; expanded background on LLM security applications