中文

通过安全表示理解并缓解大语言模型的过度拒绝

密码学与安全 2025-11-25 v1 计算与语言

摘要

大语言模型在各类自然语言处理任务中展现出强大能力,但同时也存在安全漏洞。为增强 LLM 安全性,研究者提出了多种越狱防御方法以防止有害输出。然而,模型安全性的提升往往以严重的过度拒绝为代价,未能在安全性与可用性之间取得良好平衡。本文首先从表示角度分析过度拒绝的成因,揭示过度拒绝样本位于良性样本与恶意样本的边界上。基于此,我们提出 MOSR,旨在通过干预 LLM 的安全表示来缓解过度拒绝。MOSR 包含两个新颖组件:(1) 重叠感知损失加权(Overlap-Aware Loss Weighting),通过在表示空间中量化恶意样本与伪恶意样本的相似度来确定擦除权重;(2) 上下文感知增强(Context-Aware Augmentation),通过在拒绝响应前添加有害前缀来补充拒绝决策所需的必要上下文。实验表明,我们的方法在缓解过度拒绝方面优于现有方法,同时很大程度上保持了安全性。总体而言,我们主张未来的防御方法应在安全性与过度拒绝之间取得更好的平衡。

关键词

引用

@article{arxiv.2511.19009,
  title  = {Understanding and Mitigating Over-refusal for Large Language Models via Safety Representation},
  author = {Junbo Zhang and Ran Chen and Qianli Zhou and Xinyang Deng and Wen Jiang},
  journal= {arXiv preprint arXiv:2511.19009},
  year   = {2025}
}