中文

Jailbreak-Tuning:模型高效学习越狱易感性

密码学与安全 2025-09-23 v2 人工智能 计算与语言 计算机与社会

摘要

AI 系统正快速提升其能力,前沿模型开发者普遍承认需要针对严重滥用建立防护措施。然而,本文表明,无论是通过开放权重还是封闭微调 API,都可以产生仅具帮助性且无防护的模型。与此前工作不同,后者被现代 moderation 系统阻挡,或仅实现部分防护移除,或导致输出质量下降;我们的 jailbreak-tuning 方法则教会模型生成针对任意有害请求的详细、高质量响应。例如,OpenAI、Google 和 Anthropic 的模型将完全遵从获取 CBRN 帮助、执行网络攻击及其他犯罪活动的请求。我们进一步表明,后门不仅可以增加攻击的隐蔽性,还能提升攻击的严重性。更强的 jailbreak 提示在微调攻击中甚至更为有效, linking attacks and potentially defenses in the input and weight spaces. 不仅当前模型易受攻击,更新的模型也似乎变得更容易受到这些攻击,凸显了迫切需要防篡改防护的紧迫性。直到发现此类防护,企业和政策制定者应将任何可微调模型的发布视为同时释放其邪恶双胞胎:在能力上与原模型相当,且可用于其能力范围内的任何恶意目的。

关键词

引用

@article{arxiv.2507.11630,
  title  = {Jailbreak-Tuning: Models Efficiently Learn Jailbreak Susceptibility},
  author = {Brendan Murphy and Dillon Bowen and Shahrad Mohammadzadeh and Tom Tseng and Julius Broomfield and Adam Gleave and Kellin Pelrine},
  journal= {arXiv preprint arXiv:2507.11630},
  year   = {2025}
}