中文

二十次查询内黑盒大语言模型的越狱攻击

机器学习 2024-07-22 v4 人工智能

摘要

确保大语言模型(LLMs)与人类价值观对齐的兴趣日益增长。然而,此类模型的对齐易受对抗性越狱攻击,其诱使 LLM 覆盖自身安全护栏。因此,识别这些漏洞有助于理解固有弱点并防止未来滥用。为此,我们提出提示自动迭代精炼(PAIR),一种仅需黑盒访问 LLM 即可生成语义越狱的算法。PAIR 受社会工程学攻击启发,使用攻击方 LLM 自动为另一目标 LLM 生成越狱而无需人工干预。借此,攻击方 LLM 迭代查询目标 LLM 以更新并精炼候选越狱。实证上,PAIR 通常仅需少于二十次查询即可产生越狱,比现有算法高效数个数量级。PAIR 在开源与闭源 LLM(包括 GPT-3.5/4、Vicuna 和 Gemini)上也实现了具竞争力的越狱成功率与可迁移性。

关键词

引用

@article{arxiv.2310.08419,
  title  = {Jailbreaking Black Box Large Language Models in Twenty Queries},
  author = {Patrick Chao and Alexander Robey and Edgar Dobriban and Hamed Hassani and George J. Pappas and Eric Wong},
  journal= {arXiv preprint arXiv:2310.08419},
  year   = {2024}
}