二十次查询内黑盒大语言模型的越狱攻击
机器学习
2024-07-22 v4 人工智能
摘要
确保大语言模型(LLMs)与人类价值观对齐的兴趣日益增长。然而,此类模型的对齐易受对抗性越狱攻击,其诱使 LLM 覆盖自身安全护栏。因此,识别这些漏洞有助于理解固有弱点并防止未来滥用。为此,我们提出提示自动迭代精炼(PAIR),一种仅需黑盒访问 LLM 即可生成语义越狱的算法。PAIR 受社会工程学攻击启发,使用攻击方 LLM 自动为另一目标 LLM 生成越狱而无需人工干预。借此,攻击方 LLM 迭代查询目标 LLM 以更新并精炼候选越狱。实证上,PAIR 通常仅需少于二十次查询即可产生越狱,比现有算法高效数个数量级。PAIR 在开源与闭源 LLM(包括 GPT-3.5/4、Vicuna 和 Gemini)上也实现了具竞争力的越狱成功率与可迁移性。
引用
@article{arxiv.2310.08419,
title = {Jailbreaking Black Box Large Language Models in Twenty Queries},
author = {Patrick Chao and Alexander Robey and Edgar Dobriban and Hamed Hassani and George J. Pappas and Eric Wong},
journal= {arXiv preprint arXiv:2310.08419},
year = {2024}
}