DualBreach:基于目标驱动初始化和多目标优化的高效双向劫持
密码学与安全
2025-10-07 v2 人工智能
摘要
近期研究聚焦于探索大型语言模型(LLM)的漏洞,以诱导其生成有害或敏感内容。然而,由于对双向劫持(dual-jailbreaking)的研究不足,现有攻击方法在尝试规避受护卫士屏蔽的 LLM 时效果有限。因此,本文提出 DualBreach,一种针对双向劫持的目标驱动框架。DualBreach 采用目标驱动初始化(Target-driven Initialization, TDI)策略动态构建初始提示,结合多目标优化(Multi-Target Optimization, MTO)方法利用近似梯度在护卫士和 LLM 之间联合调整提示,能够同时节省查询次数并实现高双向劫持成功率。针对黑盒护卫士,DualBreach 要么采用强大的开源护卫士,要么通过训练代理模型来模拟目标黑盒护卫士,以纳入 MTO 流程。我们通过在多个广泛使用的数据集上进行大规模评估,展示了 DualBreach 在双向劫持场景中的有效性。实验结果表明,DualBreach 在减少查询次数方面优于最先进的方法,在所有设置下均实现显著更高的成功率。具体而言,DualBreach 对 GPT-4(搭载 Llama-Guard-3 保护)的平均双向劫持成功率为 93.67%,而其他方法的最佳成功率仅为 88.33%。此外,DualBreach 每次成功双向劫持仅需平均 1.77 次查询,超越其他最先进方法。为防御目的,我们提出一种基于 XGBoost 的集成防御机制,命名为 EGuard,集成了多种护卫士的优势,性能优于 Llama-Guard-3。
引用
@article{arxiv.2504.18564,
title = {DualBreach: Efficient Dual-Jailbreaking via Target-Driven Initialization and Multi-Target Optimization},
author = {Xinzhe Huang and Kedong Xiu and Tianhang Zheng and Churui Zeng and Wangze Ni and Zhan Qin and Kui Ren and Chun Chen},
journal= {arXiv preprint arXiv:2504.18564},
year = {2025}
}
备注
20 pages, 8 figures