中文

填充级越狱:大语言模型的黑箱风险分析

密码学与安全 2025-08-27 v2 人工智能

摘要

大语言模型面临来自越狱攻击的安全威胁。现有研究主要聚焦于提示级攻击,而大幅忽略了用户控制响应填充这一较少探索的攻击面。该功能允许攻击者操控模型输出的开头,从而将攻击范式从说服转化为直接状态操控。本文present了对填充级越狱攻击的系统性黑箱安全分析。我们对这些新型攻击进行分类,并在十四个语言模型上评估其有效性。我们的实验表明,填充级攻击成功率很高,其中某些模型的自适应方法成功率超过99%。标记级概率分析揭示,这些攻击通过初始状态操控工作,即通过将拒绝的第一个标记概率更改为合规。此外,我们表明填充级越狱可作为有效的增强器,使现有提示级攻击成功率提高10至15个百分点。我们对几种防御策略的评估表明,常规内容过滤器提供的防护有限。我们发现,一种聚焦于提示与填充之间操控关系的检测方法更为有效。我们的发现揭示了当前LLM安全对齐中的缺口,并凸显了在未来安全训练中需解决填充攻击面的必要性。

关键词

引用

@article{arxiv.2504.21038,
  title  = {Prefill-level Jailbreak: A Black-Box Risk Analysis of Large Language Models},
  author = {Yakai Li and Jiekang Hu and Weiduan Sang and Luping Ma and Dongsheng Nie and Weijuan Zhang and Aimin Yu and Yi Su and Qingjia Huang and Qihang Zhou},
  journal= {arXiv preprint arXiv:2504.21038},
  year   = {2025}
}