不,当然我可以!绕过标记级安全机制的更深层微调攻击
密码学与安全
2025-07-15 v5 人工智能
机器学习
摘要
OpenAI 和 Anthropic 等主流语言模型(LM)提供商允许客户针对特定用例对前沿 LM 进行微调。为防止滥用,这些提供商应用过滤器来阻止在明显有害数据上的微调。在这一设定下,我们做出了三项贡献:第一,虽然先前工作表明安全对齐是"浅层的",我们相应地证明了现有的微调攻击也是浅层的——攻击仅针对模型响应的前几个标记,因此可以通过用对齐模型生成前几个响应标记来阻止。第二,我们概念性地展示了如何通过引入一种新的微调攻击来使攻击更深层,该攻击训练模型先拒绝有害请求再回答它们;这种"先拒后从"策略绕过了浅层防御,并产生了能够规避输出过滤器的有害响应。第三,我们通过劫持同时配备防御的开源模型和生产模型,展示了新微调攻击的效力,在 GPT-4o 和 Claude Haiku 上分别实现了 57% 和 72% 的攻击成功率。我们的攻击获得了 OpenAI 的 2000 美元漏洞悬赏,并被 Anthropic 确认为漏洞。我们的工作削弱了"模型因最初拒绝有害请求而安全"的观念,并拓宽了对生产微调 API 所面临攻击范围的认识。
引用
@article{arxiv.2502.19537,
title = {No, of Course I Can! Deeper Fine-Tuning Attacks That Bypass Token-Level Safety Mechanisms},
author = {Joshua Kazdan and Abhay Puri and Rylan Schaeffer and Lisa Yu and Chris Cundy and Jason Stanley and Sanmi Koyejo and Krishnamurthy Dvijotham},
journal= {arXiv preprint arXiv:2502.19537},
year = {2025}
}