中文

TwinBreak:基于双胞胎提示的 LLM 安全对齐绕过方法

机器学习 2025-06-10 v1

摘要

机器学习正快速发展,带来诸多益处,如翻译和代码生成方面的改进。以 ChatGPT 为代表的大型语言模型 (LLM) 正越来越多地融入日常生活。然而,随着这些益处的出现,LLM 也带来了社会风险。恶意用户可通过提交有害提示来滥用 LLM,例如请求非法活动的指令。为缓解此问题,模型通常包含安全机制,以自动拒绝此类有害提示。然而,这些机制可通过 LLM 越狱被绕过。当前的越狱方法往往需要大量手动工作、高计算成本,或会导致大量模型修改可能降低常规效用。我们引入 TwinBreak,这是一种新颖的安全对齐移除方法。基于安全机制如同嵌入式后门这一思想,TwinBreak 通过识别和修剪负责此功能的参数。我们聚焦于最相关的模型层,进行对模型效用和安全参数的细粒度分析。TwinBreak 是首个分析结构和内容高度相似的提示中间输出,以隔离安全参数的方法。在我们构建的 TwinPrompt 数据集中包含 100 个此类双胞胎提示。实验表明,TwinBreak 有效率高达 89%至 98%,在来自五家厂商的 16 个 LLM 上计算需求极低。

关键词

引用

@article{arxiv.2506.07596,
  title  = {TwinBreak: Jailbreaking LLM Security Alignments based on Twin Prompts},
  author = {Torsten Krauß and Hamid Dashtbani and Alexandra Dmitrienko},
  journal= {arXiv preprint arXiv:2506.07596},
  year   = {2025}
}

备注

26 pages, 25 tables, 13 figures, 2 algorithms, to appear in the 43th USENIX Security Symposium (USENIX Security 2025)