中文

匹配排名而非概率,实现真正的安全对齐

密码学与安全 2025-12-08 v1 人工智能

摘要

已知的一种简单技巧——预填充攻击——已被证明能有效规避前沿大语言模型的安全对齐,方法是在解码前 simply prefill assistant response with an affirmative prefix。在此基础上,最近的工作提出了一种使用数据增强实现“深层”安全对齐的监督微调(SFT)方法,允许模型在有害预填充后立即生成自然语言的拒绝。然而,我们在本工作中展示了这种“深层”安全对齐实际上并不深刻。对预填充攻击的一种推广——我们称为排名辅助预填充(RAP)攻击——能够通过在每个步骤选择预测下一个 token 的最低 20 个概率中的“有害” token(因此忽略高概率的“拒绝” token)来有效从模型中提取有害内容。我们认为,这一漏洞是由于当目标分布熵值较低时,SFT目标的“游戏化”所致:通过将大量概率质量转移到少数拒绝 token 上,同时忽略有害 token 的高排名,来实现较低的微调损失。随后,我们提出一种新观点:通过匹配目标分布的 token 排名来实现深层安全对齐,而非其概率。这一观点导致了一种意想不到简单粗暴的解决方案,即基于正则化对有害预填充 token 的注意力的做法,我们称之为 PRefill attEntion STOpping(PRESTO)。将PRESTO添加到模型后,可在三种流行开源 LLM 上执行RAP攻击的平均 StrongREJECT 分数提升最高可达4.7倍,同时对模型实用性影响较小。

关键词

引用

@article{arxiv.2512.05518,
  title  = {Matching Ranks Over Probability Yields Truly Deep Safety Alignment},
  author = {Jason Vega and Gagandeep Singh},
  journal= {arXiv preprint arXiv:2512.05518},
  year   = {2025}
}