无需梯度或先验条件的 LLM 越狱攻击
机器学习
2026-01-08 v1 人工智能
密码学与安全
摘要
随着大型语言模型(LLM)在安全关键领域的部署增多,对其针对对抗性越狱的鲁棒性进行严格评估变得至关重要。然而,当前的安全评估常常会高估鲁棒性,因为现有自动化攻击受到限制性假设的制约。它们通常依赖手工设计的先验条件,或需要白盒访问以进行梯度传播。我们通过表明无需梯度或先验条件即可实现 token 级迭代优化来挑战这些限制。我们引入RAILS(RAndom Iterative Local Search),一个仅基于模型逻辑 logits 的框架。RAILS通过两种关键创新:一种新颖的自回归损失以确保精确的前缀匹配,以及一种基于历史的选择策略来弥合代理优化目标与真实攻击成功率之间的差距。至关重要的是,RAILS通过消除对梯度的依赖,实现了跨分词器集成攻击。这使得发现能够在不相连词汇表之间普遍化的对抗模式成为可能,显著提升了对封闭源系统(如 GPT 和 Gemini)的黑盒攻击转移性。经验上,RAILS在多个开源模型上实现近百分之百的成功率,并在封闭源系统上实现高水平的黑盒攻击转移性。
引用
@article{arxiv.2601.03420,
title = {Jailbreaking LLMs Without Gradients or Priors: Effective and Transferable Attacks},
author = {Zhakshylyk Nurlanov and Frank R. Schmidt and Florian Bernard},
journal= {arXiv preprint arXiv:2601.03420},
year = {2026}
}