中文

战略偏转:对抗LLM的logit操控攻击

密码学与安全 2025-07-31 v1 人工智能 计算与语言

摘要

随着大型语言模型(LLM)在关键领域的广泛应用,确保其免受劫持攻击的安全性至关重要。虽然传统防御主要依赖于拒绝恶意提示,但近期的logit级攻击已显示出能够通过操控生成过程中的token选择过程来绕过这些安全措施的能力。我们提出了战略偏转(SDeflection)防御机制,重新定义了LLM对此类高级攻击的响应方式。与直接拒绝不同,模型会生成与用户请求语义相邻却剥离有害意图的答案,从而中和攻击者的有害意图。我们的实验表明,SDeflection显著降低了攻击成功率(ASR),同时保持了对良性查询的模型性能。这一工作标志着防御策略的关键性转变,从简单的拒绝转向战略内容转向,以中和高级威胁。

关键词

引用

@article{arxiv.2507.22160,
  title  = {Strategic Deflection: Defending LLMs from Logit Manipulation},
  author = {Yassine Rachidy and Jihad Rbaiti and Youssef Hmamouche and Faissal Sehbaoui and Amal El Fallah Seghrouchni},
  journal= {arXiv preprint arXiv:2507.22160},
  year   = {2025}
}

备注

20 pages