中文

STShield:面向大语言模型实时越狱检测的单token哨兵

计算与语言 2025-03-25 v1 人工智能 密码学与安全

摘要

大语言模型(LLM)日益暴露于越狱攻击,这类攻击会绕过其安全机制。虽然已有防御方法要么 suffer 从adaptive攻击,要么需要计算昂贵的辅助模型,但我们提出STShield,一种用于实时越狱判断的轻量级框架。STShield引入一种新颖的单token哨兵机制,将二元安全指示器附加到模型响应序列中,利用LLM自身的对齐能力进行检测。我们的框架结合正常提示的监督微调和基于嵌入空间扰动的对抗训练,实现了鲁棒的检测,同时保持模型实用性。大量实验表明,STShield成功防御了各种越狱攻击,同时保持模型对合法查询的性能。与现有方法相比,STShield在防御性能上取得优势,同时计算开销最小,具有在实际场景中部署的实用性。

关键词

引用

@article{arxiv.2503.17932,
  title  = {STShield: Single-Token Sentinel for Real-Time Jailbreak Detection in Large Language Models},
  author = {Xunguang Wang and Wenxuan Wang and Zhenlan Ji and Zongjie Li and Pingchuan Ma and Daoyuan Wu and Shuai Wang},
  journal= {arXiv preprint arXiv:2503.17932},
  year   = {2025}
}

备注

11 pages