中文

单触发标记足以:大语言模型安全性与可用性平衡的防御策略

密码学与安全 2026-01-05 v3 计算与语言

摘要

大语言模型(LLM)已广泛应用于虚拟助手、自动代码生成和科学研究等多个领域。然而,它们仍然容易受到越狱攻击的威胁,这类攻击会操纵模型生成有害响应,尽管已进行安全对齐。近期研究表明当前安全对齐的 LLM 仅进行浅层安全对齐。本文深入调查了这一现象的底层机制,揭示其通过学习的"安全触发标记"实现,当这些标记与特定输入搭配时,会激活模型的安全模式。通过分析和实证验证,我们进一步表明,针对不同有害输入,安全触发标记高度相似。基于此,我们提出了 D-STT(Decode Safety Trigger Tokens)一种简单而有效的防御算法,用于识别并显式解码给定安全对齐 LLM 的安全触发标记,以激活模型所学习的安全模式。在此过程中,安全触发标记被限制为单个标记,这有效地通过最小干预来保持模型的可用性。广泛的实验在多种越狱攻击和良性提示下表明,D-STT 显著降低了输出的有害性,同时保持了模型的可用性并产生可忽略的响应时间开销,优于十个基线方法。

关键词

引用

@article{arxiv.2505.07167,
  title  = {One Trigger Token Is Enough: A Defense Strategy for Balancing Safety and Usability in Large Language Models},
  author = {Haoran Gu and Handing Wang and Yi Mei and Mengjie Zhang and Yaochu Jin},
  journal= {arXiv preprint arXiv:2505.07167},
  year   = {2026}
}