中文

攻击树:自动越狱黑盒 LLM

机器学习 2024-11-01 v3 人工智能 计算与语言 密码学与安全 机器学习

摘要

尽管大型语言模型(LLM)展现出多功能性,但它们继续生成有害、有偏见和有毒的内容,正如人工设计的越狱所普遍存在的那样。在这项工作中,我们提出了带有剪枝的攻击树(TAP),这是一种自动生成越狱的方法,仅需对目标 LLM 的黑盒访问权限。TAP 利用攻击者 LLM 迭代地细化候选(攻击)提示,直到其中一个细化的提示越狱目标。此外,在向目标发送提示之前,TAP 会对它们进行评估并剪枝那些不太可能导致越狱的提示,从而减少发送到目标 LLM 的查询数量。在实证评估中,我们观察到 TAP 生成的提示能越狱最先进的 LLM(包括 GPT4-Turbo 和 GPT4o),成功率超过 80%。这显著改进了先前最先进的黑盒越狱生成方法,同时使用的查询数量比它们更少。此外,TAP 还能够越狱受最先进护栏(例如 LlamaGuard)保护的 LLM。

关键词

引用

@article{arxiv.2312.02119,
  title  = {Tree of Attacks: Jailbreaking Black-Box LLMs Automatically},
  author = {Anay Mehrotra and Manolis Zampetakis and Paul Kassianik and Blaine Nelson and Hyrum Anderson and Yaron Singer and Amin Karbasi},
  journal= {arXiv preprint arXiv:2312.02119},
  year   = {2024}
}

备注

Accepted for presentation at NeurIPS 2024. Code: https://github.com/RICommunity/TAP