AdvPrefix:用于精细 LLM 越狱攻击的目标函数
机器学习
2025-12-30 v2 人工智能
计算与语言
密码学与安全
摘要
许多针对大型语言模型(LLMs)的越狱攻击依赖于一个共同目标:使模型以前缀“Sure, here is (有害请求)”进行回复。虽然直接,但该目标有两个局限性:对模型行为的控制有限,导致越狱回复不完整或不切实际;以及阻碍优化的僵化格式。我们引入了 AdvPrefix,一个即插即用的前缀强制目标函数,它通过结合两个标准来选择一个或多个依赖模型的前缀:高预填充攻击成功率和低负对数似然。AdvPrefix 无缝集成到现有的越狱攻击中,以免费缓解上述局限性。例如,在 Llama-3 上替换 GCG 的默认前缀,将精细攻击成功率从 14% 提高到 80%,这表明当前的安全对齐未能推广到新的前缀。代码和选定的前缀发布于 github.com/facebookresearch/jailbreak-objectives。
引用
@article{arxiv.2412.10321,
title = {AdvPrefix: An Objective for Nuanced LLM Jailbreaks},
author = {Sicheng Zhu and Brandon Amos and Yuandong Tian and Chuan Guo and Ivan Evtimov},
journal= {arXiv preprint arXiv:2412.10321},
year = {2025}
}