不要忽视隐形弱点:揭示对齐 LLM 拒绝边界的隐藏弱点
人工智能
2025-06-18 v3
摘要
最近的大语言模型(LLM)进展导致显著的对齐效果,模型通过监督微调(SFT)和基于人类反馈的强化学习(RLHF)学习区分有害与无害查询。在本文中,我们揭示了这些对齐模型中的一个微妙而有影响力的弱点。我们发现,仅附加多个 end of sequence(eos)token 即可导致一种我们称为上下文分段的现象,这实际上将有害和良性输入都拉近到拒绝边界。在此基础上,我们提出了一种简单方法,通过附加 eos token 来提升 jailbreak 攻击成功率。我们的系统评估显示,这一策略在 8 种代表性 jailbreak 技术和 16 个开源 LLM(参数从 2B 到 72B)上显著提高了攻击成功率。此外,我们开发了一种新型探针机制,用于商业 API,发现主要提供商如 OpenAI、Anthropic 和 Qwen 不会过滤 eos token,因而同样易受攻击。这些发现凸显了现有对齐和内容过滤方法中的一个隐藏且关键的盲点。我们呼吁对 eos token 的意外影响在模型行为中的作用保持高度警惕,尤其是在生产系统中。我们的工作不仅呼吁基于输入过滤的防御,还指向使拒绝边界更稳健和通用的新型防御措施,以及能够抵御上下文分段攻击的根本对齐技术。
引用
@article{arxiv.2405.20653,
title = {Mind the Inconspicuous: Revealing the Hidden Weakness in Aligned LLMs' Refusal Boundaries},
author = {Jiahao Yu and Haozheng Luo and Jerry Yao-Chieh Hu and Wenbo Guo and Han Liu and Xinyu Xing},
journal= {arXiv preprint arXiv:2405.20653},
year = {2025}
}
备注
published at USENIX Security 25