中文

当风格破坏安全性:防御LLM对浅层风格对齐的攻击

机器学习 2026-02-26 v3 人工智能 计算与语言 计算机与社会

摘要

大型语言模型(LLM)可以被特定风格(例如将响应格式化为列表)的查询所构成,包括恶意查询。先前的越狱研究主要通过添加额外字符串转换来最大化攻击成功率(ASR)。然而,原始查询中与恶意意图在语义上无关的风格模式的影响尚不明确。在本工作中,我们寻求理解风格模式是否会损害LLM安全性,浅层风格对齐如何增加模型脆弱性,以及如何在对齐期间最佳化解这些风险。我们首先定义ASR膨胀,即由于现有越狱基准查询中风格模式导致的ASR增加。通过评估36个LLM跨七个基准测试,我们发现几乎所有模型都表现出ASR膨胀。值得注意的是,膨胀与LLM对风格模式的相对注意力相关,这些注意力在膨胀发生时也更常出现在其指令微调数据中。我们然后研究浅层风格对齐,发现使用特定风格进行微调会使LLM对该等风格的越狱更脆弱。最后,我们提出SafeStyle,对抗策略,包含一小部分安全训练数据,增强以匹配微调数据中风格模式的分布。在三个LLM、六种微调风格设置和两个真实世界指令微调数据集上,SafeStyle在保持LLM安全性方面始终优于基线方法。

关键词

引用

@article{arxiv.2506.07452,
  title  = {When Style Breaks Safety: Defending LLMs Against Superficial Style Alignment},
  author = {Yuxin Xiao and Sana Tonekaboni and Walter Gerych and Vinith Suriyakumar and Marzyeh Ghassemi},
  journal= {arXiv preprint arXiv:2506.07452},
  year   = {2026}
}

备注

Accepted by ICLR 2026