中文

PAPILLON:基于模糊测试的高效且不显眼的 LLM 恶意刷子攻击

密码学与安全 2025-03-04 v5 人工智能

摘要

大型语言模型 (LLM) 在各种任务中表现出色,但仍然容易受到恶意刷子攻击,攻击者会创建恶意刷子提示来误导模型生成有害或冒犯内容。当前的恶意刷子方法要么依赖大量手动制作的模板,这在可扩展性和适应性方面存在挑战,要么难以生成语义连贯的提示,使其容易被检测。此外,大多数现有方法涉及冗长的提示,导致更高的查询成本。为解决这些挑战,本文引入一种名为 PAPILLON 的新型恶意刷子攻击框架,它是一种自动化、黑盒恶意刷子攻击框架,采用一系列定制化设计将黑盒模糊测试方法融入。PAPILLON 不依赖手动制作的模板,从空的种子池开始,无需搜索任何相关恶意刷子模板。我们还开发了三个基于问题的变异策略,使用 LLM 辅助生成保持语义连贯性且显著缩短提示长度的提示。此外,我们实现了一个两级评判模块来准确检测真正成功的恶意刷子。我们在 7 个代表性 LLM 上评估了 PAPILLON,并将其与 5 种最先进的恶意刷子攻击策略进行了比较。对于专有 LLM API,如 GPT-3.5 turbo、GPT-4 和 Gemini-Pro,PAPILLON 分别实现了超过 90%、80% 和 74% 的攻击成功率,显著超过现有基准水平超过 60%。此外,PAPILLON 能够在保持高语义连贯性的同时显著缩短恶意刷子提示的长度。当针对 GPT-4 时,PAPILLON 即使在 100 个 token 限制下也能实现超过 78% 的攻击成功率。此外,PAPILLON 显示出可迁移性且对最先进的防御措施具有鲁棒性。代码:https://github.com/aaFrostnova/Papillon

关键词

引用

@article{arxiv.2409.14866,
  title  = {PAPILLON: Efficient and Stealthy Fuzz Testing-Powered Jailbreaks for LLMs},
  author = {Xueluan Gong and Mingzhe Li and Yilin Zhang and Fengyuan Ran and Chen Chen and Yanjiao Chen and Qian Wang and Kwok-Yan Lam},
  journal= {arXiv preprint arXiv:2409.14866},
  year   = {2025}
}