战略偏转:对抗LLM的logit操控攻击
密码学与安全
2025-07-31 v1 人工智能
计算与语言
摘要
随着大型语言模型(LLM)在关键领域的广泛应用,确保其免受劫持攻击的安全性至关重要。虽然传统防御主要依赖于拒绝恶意提示,但近期的logit级攻击已显示出能够通过操控生成过程中的token选择过程来绕过这些安全措施的能力。我们提出了战略偏转(SDeflection)防御机制,重新定义了LLM对此类高级攻击的响应方式。与直接拒绝不同,模型会生成与用户请求语义相邻却剥离有害意图的答案,从而中和攻击者的有害意图。我们的实验表明,SDeflection显著降低了攻击成功率(ASR),同时保持了对良性查询的模型性能。这一工作标志着防御策略的关键性转变,从简单的拒绝转向战略内容转向,以中和高级威胁。
引用
@article{arxiv.2507.22160,
title = {Strategic Deflection: Defending LLMs from Logit Manipulation},
author = {Yassine Rachidy and Jihad Rbaiti and Youssef Hmamouche and Faissal Sehbaoui and Amal El Fallah Seghrouchni},
journal= {arXiv preprint arXiv:2507.22160},
year = {2025}
}
备注
20 pages