朋友还是敌人:LLM 安全意识如何被意图转移攻击所蒙蔽
计算与语言
2025-11-04 v1
摘要
大型语言模型(LLM)尽管拥有惊人的能力,仍然对 jailbreaking 攻击保持脆弱态度。调查这些弱点对于构建稳健的安全机制至关重要。现有攻击主要通过引入额外的上下文或对抗性标记来分散 LLM 的注意力,却未改变攻击的核心有害意图。本文介绍了 ISA(意图转移攻击),它掩盖了 LLM 关于攻击意图的认知。具体而言,我们建立了意图转换的分类体系,并利用其生成可能被误认为是信息查询的善意请求的攻击。不同于依赖复杂标记或冗长上下文的方法,本方法仅需对原始请求进行最小编辑,即可生成自然、人类可读且看似无害的提示。对开源和商业 LLM 进行大量实验表明,ISA 相比直接有害提示在攻击成功率上提升超过 70%。更关键的是,仅用 ISA 模板改写的良性数据进行微调,即可将成功率提升至近 100%。在防御方面,我们评估了现有方法,发现其对 ISA 几乎无能为力;同时探讨了训练免费和训练基的缓解策略。我们的发现揭示了 LLM 安全意图推断的根本挑战,凸显了需要更有效防御的必要性。我们的代码和数据集已提供于 https://github.com/NJUNLP/ISA。
引用
@article{arxiv.2511.00556,
title = {Friend or Foe: How LLMs' Safety Mind Gets Fooled by Intent Shift Attack},
author = {Peng Ding and Jun Kuang and Wen Sun and Zongyu Wang and Xuezhi Cao and Xunliang Cai and Jiajun Chen and Shujian Huang},
journal= {arXiv preprint arXiv:2511.00556},
year = {2025}
}
备注
Preprint, 14 pages, 5 figures, 7 tables