中文

高度受限黑箱环境下的微调越狱攻击:三阶段方法

密码学与安全 2025-10-10 v2

摘要

随着大型语言模型 (LLM) 的快速发展,确保其安全使用变得日益关键。微调是适用于下游任务的广泛方法,然而它易受越狱攻击的威胁。然而,现有大多数研究聚焦于过于简化的攻击情景,限制了其在现实防御环境中的实际相关性。为使风险具体化,我们提出一种三阶段越狱攻击,并在仅具备数据集的黑箱微调接口下对其进行评估。在此设置下,攻击者仅可向提供方提交微调数据,而提供方可能在各阶段部署防御措施:(1) 前上传数据过滤、(2) 训练时防御性微调、(3) 后训练安全审计。我们的攻击结合了安全风格的前缀/后缀包装器、对敏感标记的良性词法编码(下划线)以及后门机制,使模型能够在单个数据点看似无害的前提下学习有害行为。大量实验表明,我们方法的有效性。 在实际部署中,我们的方法在 OpenAI 平台上成功越狱 GPT-4.1 和 GPT-4o,两个模型的攻击成功率均超过 97%。我们的代码已公开于 https://github.com/lxf728/tri-pronged-ft-attack。

关键词

引用

@article{arxiv.2510.01342,
  title  = {Fine-Tuning Jailbreaks under Highly Constrained Black-Box Settings: A Three-Pronged Approach},
  author = {Xiangfang Li and Yu Wang and Bo Li},
  journal= {arXiv preprint arXiv:2510.01342},
  year   = {2025}
}