中文

Knowledge-to-Jailbreak:探索大语言模型的知识驱动性越狱攻击

计算与语言 2025-06-10 v2 人工智能 密码学与安全

摘要

大型语言模型 (LLMs) 正在越来越多地应用于 various 领域,这引发了对 LLMs 在特定领域安全性(例如医疗领域)的日益担忧。尽管已对 general 越狱攻击进行了探索,但针对 testing 大语言模型 domain-specific 安全性的现有攻击存在两个挑战:(1) 缺乏专业知识驱动的攻击,(2) 对 domain knowledge 的覆盖不足。为弥合这一差距,我们提出了 new 任务 knowledge-to-jailbreak,旨在从 domain knowledge 生成越狱攻击,要求攻击有效且与知识相关。我们收集了大规模数据集,包含 12,974 个 knowledge-jailbreak 对,并微调大型语言模型作为 jailbreak-generator,以生成针对 domain knowledge 的越狱攻击。在 13 个领域和 8 个目标 LLMs 上进行实验,表明 jailbreak-generator 在生成既针对目标 LLMs 又与给定 knowledge 相关的越狱攻击方面效果显著。我们还将方法应用于 out-of-domain knowledge base,结果显示 jailbreak-generator 生成的越狱攻击在有害性方面与由 human expert 精心策划的相当。数据和代码均可在 https://github.com/THU-KEG/Knowledge-to-Jailbreak/ 获取。

关键词

引用

@article{arxiv.2406.11682,
  title  = {Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models},
  author = {Shangqing Tu and Zhuoran Pan and Wenxuan Wang and Zhexin Zhang and Yuliang Sun and Jifan Yu and Hongning Wang and Lei Hou and Juanzi Li},
  journal= {arXiv preprint arXiv:2406.11682},
  year   = {2025}
}

备注

Accepted by KDD 2025 research track