中文

面向大语言模型的通用黑盒查询-响应仅攻击方法 QROA

计算与语言 2025-05-08 v3 机器学习

摘要

大型语言模型 (LLM) 的快速普及暴露了其对对抗性操纵的关键安全和伦理漏洞,尤其是其对对抗性后缀的脆弱性。本文引入 QROA,一种 novel 的黑盒越狱方法,用于识别能够绕过 LLM 对齐安全措施的对抗后缀,当追加到恶意指令后即可实现攻击。不同于现有的后缀-based 攻击方法,QROA 不需要访问模型的 logit 或其他内部信息,也不依赖人工制作的模板,仅通过 LLM 的标准查询-响应接口操作。将攻击定义为优化 bandit 问题,QROA 采用代理模型和 token 级优化来高效探索后缀变体。此外,我们提出 QROA-UNV,该扩展识别针对单个模型的通用对抗后缀,实现对广泛指令的单查询越狱。在多个模型上进行测试,攻击成功率 (ASR) 超过 80\%。这些发现凸显了关键漏洞,强调了需要先进防御的必要性,并为开发更健壮的安全评估做出了贡献,以实现安全的 AI 部署。代码已公开于以下链接: https://github.com/qroa/QROA

关键词

引用

@article{arxiv.2406.02044,
  title  = {Towards Universal and Black-Box Query-Response Only Attack on LLMs with QROA},
  author = {Hussein Jawad and Yassine Chenik and Nicolas J. -B. Brunel},
  journal= {arXiv preprint arXiv:2406.02044},
  year   = {2025}
}