中文

KDA:面向生成多样化提示词的知识蒸馆攻击者

密码学与安全 2025-02-11 v1 人工智能 计算与语言 机器学习

摘要

越狱攻击利用特定提示词绕过 LLM 安全措施,使其生成有害、不恰当且偏离原则的内容。当前的越狱方法高度依赖精心设计的系统提示和大量查询才能实现单次成功攻击,这在大规模红队测试中成本高昂且不切实际。为此,我们提出将多个 SOTA 攻击者的知识蒸馏到单个开源模型中,称为知识蒸馆攻击者(KDA),通过微调实现自动生成连贯且多样化的攻击提示,而无需精心设计系统提示。与现有攻击者相比,KDA 在针对多个 SOTA 开源和商业黑箱 LLM 时实现了更高的攻击成功率和更大的成本-时间效率。此外,我们对基线方法和 KDA 生成的提示进行了定量的多样性分析,识别出多样化和集成攻击是 KDA 有效性和效率的关键因素。

关键词

引用

@article{arxiv.2502.05223,
  title  = {KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs},
  author = {Buyun Liang and Kwan Ho Ryan Chan and Darshan Thaker and Jinqi Luo and René Vidal},
  journal= {arXiv preprint arXiv:2502.05223},
  year   = {2025}
}