中文

BlackDAN:面向大语言模型的黑箱多目标方法以提升情境化越狱效果

密码学与安全 2024-11-28 v3 人工智能 计算与语言 机器学习 神经与进化计算

摘要

尽管大语言模型(LLMs)在各类任务中展现出惊人的能力,但它们仍面临潜在的安全风险,如越狱攻击,这类攻击会利用漏洞绕过安全措施,生成有害输出。现有的越狱策略主要关注最大化攻击成功率(ASR),常常忽略其他关键因素,包括越狱响应与查询之间的相关性以及隐蔽性。这种单目标狭隘的关注可能导致效果不佳的攻击,或缺乏情境相关性,或容易被识别。本文引入BlackDAN,一种创新的黑箱攻击框架,采用多目标优化,旨�生成高质量的提示词,以有效促进越狱,同时保持情境相关性并降低可检测性。BlackDAN利用多目标演化算法(MOEAs),具体为NSGA-II算法,对包括ASR、隐蔽性和语义相关性在内的多个目标进行优化。通过集成变异、交叉和帕累托支配机制,BlackDAN为生成越狱提供透明且可解释的过程。此外,该框架允许根据用户偏好进行定制,使能够选择在有害性、相关性等因素之间进行平衡的提示词。实验结果表明,BlackDAN优于传统单目标方法,无论是在 various LLMs 还是多模态 LLMs 上,都实现了更高的成功率和更好的鲁棒性,同时确保越狱响应既相关且更难被检测到。

关键词

引用

@article{arxiv.2410.09804,
  title  = {BlackDAN: A Black-Box Multi-Objective Approach for Effective and Contextual Jailbreaking of Large Language Models},
  author = {Xinyuan Wang and Victor Shea-Jay Huang and Renmiao Chen and Hao Wang and Chengwei Pan and Lei Sha and Minlie Huang},
  journal= {arXiv preprint arXiv:2410.09804},
  year   = {2024}
}