攻击图:面向大语言模型的改进型黑箱及可解释越狱方法
计算与语言
2025-04-29 v1 人工智能
密码学与安全
摘要
确保大语言模型(LLM)符合社会标准的挑战日益受到关注,因为这些模型仍容易发生误导性越狱,以规避其安全机制。识别这些漏洞对于增强LLM抵御此类攻击的鲁棒性至关重要。我们提出了攻击图方法(Graph of ATtacks,GoAT),用于基于“思想图”框架生成对抗性提示,以测试LLM对齐的鲁棒性。GoAT在针对受保护模型(如Llama)时,仅需针对受害者模型调用更少的查询次数,即可实现最新先进攻击方法的五倍以上成功率。值得注意的是,GoAT生成的高质量、人类可读提示无需访问受目标模型的参数,因而属于黑箱攻击。不同于受树状推理限制的方法,GoAT的推理基于更复杂的图结构。通过使同时的攻击路径相互 awareness 对方的进展,此动态框架允许对推理路径进行更深入的集成和细化,显著增强了对LLM对抗性漏洞的协作探索。从技术层面看,GoAT从图结构开始,迭代细化其结构,通过组合和改进思想,实现不同思想路径之间的协同效应。我们的实现代码可在 https://github.com/GoAT-pydev/Graph_of_Attacks 查阅。
引用
@article{arxiv.2504.19019,
title = {Graph of Attacks: Improved Black-Box and Interpretable Jailbreaks for LLMs},
author = {Mohammad Akbar-Tajari and Mohammad Taher Pilehvar and Mohammad Mahmoody},
journal= {arXiv preprint arXiv:2504.19019},
year = {2025}
}
备注
19 pages, 1 figure, 6 tables