Super Suffixes:同时绕过文本生成对齐与防御模型
密码学与安全
2025-12-15 v1 人工智能
摘要
大型语言模型(LLM)的快速部署,使得在机器学习(ML)中增强安全与隐私措施的需求变得极为迫切。LLM 越来越多地被用于处理不可信的文本输入,甚至生成可执行代码,且通常可以访问敏感的系统控制权限。为了应对这些安全问题,多家公司引入了防御模型,这是一种较小的专用模型,旨在保护文本生成模型免受对抗性或恶意输入的破坏。在本工作中,我们通过引入 Super Suffixes 推进了对对抗性输入的研究,这是一种能够覆盖不同分词方案下多种模型的对齐目标的攻击后缀。我们通过联合优化技术,成功绕过了 Llama Prompt Guard 2 在五种不同文本生成模型上对恶意文本与代码生成的保护机制,从而证明了它们的有效性。据我们所知,这是首个揭示 Llama Prompt Guard 2 可通过联合优化被攻破的研究。此外,通过分析模型在处理词元序列期间其内部状态与特定概念方向之间相似性的变化,我们提出了一种有效且轻量级的检测 Super Suffix 攻击的方法。我们证明,残差流与特定概念方向之间的余弦相似性可作为模型意图的独特指纹。我们提出的对策 DeltaGuard 显著提升了对由 Super Suffixes 生成的恶意提示的检测能力。它将非良性分类率提升至近 100%,使 DeltaGuard 成为防御模型栈的重要补充,并增强了对对抗性提示攻击的鲁棒性。
引用
@article{arxiv.2512.11783,
title = {Super Suffixes: Bypassing Text Generation Alignment and Guard Models Simultaneously},
author = {Andrew Adiletta and Kathryn Adiletta and Kemal Derya and Berk Sunar},
journal= {arXiv preprint arXiv:2512.11783},
year = {2025}
}
备注
13 pages, 5 Figures