LightDefense:基于移位 token 分布的轻量级不确定性驱动防御机制
密码学与安全
2025-11-21 v2 计算机与社会
摘要
大型语言模型 (Large Language Model, LLM) 面临来自越狱提示的威胁。现有针对越狱攻击的防御方法主要基于辅助模型,这些策略通常需要大量数据收集或训练。我们提出了 LightDefense,一种针对白盒模型的轻量级防御机制,利用 safety-oriented (安全导向) 方向调整词汇中 token 的概率,使安全声明在按概率降序排列后成为 top tokens。我们进一步创造性地利用 LLM 对提示的不确定性来衡量其有害性,并自适应调整防御强度,从而有效平衡安全性和有用性。LightDefense 在防御 5 种攻击方法和 2 个目标 LLM 时的有效性表明,该方法在不损害对善意用户查询有用性的前提下,显示出作为一种新型轻量级防御机制的潜力,从而增强了 LLM 的安全性。
引用
@article{arxiv.2504.01533,
title = {LightDefense: A Lightweight Uncertainty-Driven Defense against Jailbreaks via Shifted Token Distribution},
author = {Zhuoran Yang and Yanyong Zhang},
journal= {arXiv preprint arXiv:2504.01533},
year = {2025}
}