中文

解密混沌:通过对抗性提示翻译提升越狱攻击效果

机器学习 2025-01-22 v2 计算与语言 密码学与安全

摘要

自动对抗性提示生成在越狱安全对齐的大语言模型(LLM)方面取得了显著成功。现有基于梯度的攻击方法虽在白盒LLM上展现出色,但常生成外观混乱的对抗性提示。这些对抗性提示难以迁移到其他模型,限制了其针对未知受害模型的攻击效果。本文首次深入探讨混乱对抗性提示中所蕴含的语义信息,提出一种新方法将其"翻译"为连贯且人类可读的自然语言对抗性提示。如此一来,我们能够有效揭示触发模型漏洞的语义信息,并无条件地将其传递给受害模型,同时不忽略混乱文本中隐藏的对抗信息,从而增强越狱攻击。该方法也为发现有效的越狱提示设计提供了新思路,推动了对越狱攻击的理解。实验结果表明,我们的方法在针对各种安全对齐LLM的越狱攻击成功率上显著提升,相较于现有方法取得大幅优势。在HarmBench上,使用不超过10次查询即可实现对7个商业闭源LLM(包括GPT和Claude-3系列)的平均攻击成功率达到81.8%。在AdvBench上,我们的方法对Llama-2-Chat模型的攻击成功率超过90%,尽管这些模型对越狱攻击具有显著抵抗力。代码地址:https://github.com/qizhangli/Adversarial-Prompt-Translator。

关键词

引用

@article{arxiv.2410.11317,
  title  = {Deciphering the Chaos: Enhancing Jailbreak Attacks via Adversarial Prompt Translation},
  author = {Qizhang Li and Xiaochen Yang and Wangmeng Zuo and Yiwen Guo},
  journal= {arXiv preprint arXiv:2410.11317},
  year   = {2025}
}