芝麻开门!大语言模型的通用黑盒越狱攻击
计算与语言
2024-08-06 v4 计算机视觉与模式识别
神经与进化计算
摘要
大语言模型(LLMs)旨在提供有用且安全的回复,通常依赖对齐技术以契合用户意图与社会准则。遗憾的是,这种对齐可能被恶意行为者利用,以操纵 LLM 的输出用于非预期目的。本文提出一种新方法,采用遗传算法(GA)在模型架构与参数不可访问的情况下操纵 LLM。该 GA 攻击通过优化一个通用对抗提示——与用户查询结合时——破坏被攻击模型的对齐,导致非预期且潜在有害的输出。我们的新方法通过揭示模型响应偏离预期行为的实例,系统地暴露模型的局限性与漏洞。通过大量实验,我们证明了该技术的有效性,从而通过提供用于评估并增强 LLM 与人类意图对齐的诊断工具,为关于负责任 AI 开发的持续讨论作出贡献。据我们所知,这是首个自动化的通用黑盒越狱攻击。
引用
@article{arxiv.2309.01446,
title = {Open Sesame! Universal Black Box Jailbreaking of Large Language Models},
author = {Raz Lapid and Ron Langberg and Moshe Sipper},
journal= {arXiv preprint arXiv:2309.01446},
year = {2024}
}
备注
Accepted at SeT-LLM @ ICLR 2024