一个模型迁移至所有场景:面向大语言模型的鲁棒越狱提示生成
密码学与安全
2025-05-26 v1 计算与语言
摘要
大语言模型(LLM)的安全对齐正日益受到越狱攻击的威胁,这些攻击能够操控模型生成有害或非预期内容。研究这些攻击对于揭示模型漏洞至关重要。然而,许多现有的越狱策略难以跟上防御机制(如防御性后缀)的快速发展,从而在面对经过防御的模型时失效。为解决这一问题,我们提出了一种新型攻击方法 ArrAttack,专门针对经过防御的大语言模型。ArrAttack 能够自动生成可绕过多种防御措施的鲁棒越狱提示。该能力由一个通用鲁棒性判断模型支撑,该模型一旦训练完成,即可对任意目标模型进行鲁棒性评估,涵盖多种防御机制。利用该模型,我们可以快速开发一个鲁棒越狱提示生成器,高效地将恶意输入提示转化为有效攻击。大量评估表明,ArrAttack 显著优于现有攻击策略,在白盒和黑盒模型(包括 GPT-4 和 Claude-3)上均展现出强大的迁移性。我们的工作弥合了越狱攻击与防御之间的空白,为生成鲁棒越狱提示提供了新视角。代码库已发布于 https://github.com/LLBao/ArrAttack。
引用
@article{arxiv.2505.17598,
title = {One Model Transfer to All: On Robust Jailbreak Prompts Generation against LLMs},
author = {Linbao Li and Yannan Liu and Daojing He and Yu Li},
journal= {arXiv preprint arXiv:2505.17598},
year = {2025}
}