中文

超越表面模式:针对LLM劫持攻击的本质驱动防御框架

密码学与安全 2025-05-29 v2

摘要

虽然已对齐的大型语言模型(LLM)被训练以拒绝有害请求,但它们仍然 vulnerable to(易受)劫持攻击。不幸的是,现有方法通常关注表面级模式,忽略了更深层的攻击本质。结果是,当攻击提示变化时(尽管底层“攻击本质”不变)防御措施会失败。为此,本文引入 EDDF,即 \textbf{E}ssence-\textbf{D}riven \textbf{D}efense \textbf{F}ramework(本质驱动防御框架),用于对抗 LLM 中的劫持攻击。EDDF 是一个即插即用的数据过滤方法,包含两个阶段:1)离线本质数据库构建,2)在线对抗查询检测。EDDF 的关键思想是从多样化的已知攻击实例中提取“攻击本质”,并将其存储在离线向量数据库中。实验结果表明,EDDF 显著优于现有方法,通过至少降低 20% 的攻击成功率,凸显了其对劫持攻击的优越鲁棒性。

关键词

引用

@article{arxiv.2502.19041,
  title  = {Beyond Surface-Level Patterns: An Essence-Driven Defense Framework Against Jailbreak Attacks in LLMs},
  author = {Shiyu Xiang and Ansen Zhang and Yanfei Cao and Yang Fan and Ronghao Chen},
  journal= {arXiv preprint arXiv:2502.19041},
  year   = {2025}
}

备注

16 pages, 12 figures, ACL 2025 findings