中文

超越拒绝过度: 基于情景的拒绝诊断与事后缓解方法

计算与语言 2025-12-19 v3

摘要

大型语言模型(LLM)常常会产生虚假拒绝,对包含类似不安全查询术语的善意请求进行拒绝。我们通过引入两个全面的基准来解决这一挑战:用于单轮提示的夸大安全基准(Exaggerated Safety Benchmark, XSB),标注了可识别拒绝诱因触发词的“Focus”关键词;以及多轮情景式夸大安全基准(Multi-turn Scenario-based Exaggerated Safety Benchmark, MS-XSB),系统评估在真实情境中对话设置下的拒绝校准。我们的基准显示,夸大拒绝在 diverse recent LLMs 中仍然普遍存在,尤其在复杂的多轮情景中表现突出。为缓解这些问题,我们利用事后解释方法识别拒绝触发词,并在推理阶段部署三种轻量级、模型无关的方法:忽略词指令、提示重写和注意力引导,无需重新训练或获取模型参数。实验在四个指令调优 Llama 模型上表明,这些策略在保持稳健安全保护的同时,显著提高了对安全提示的合规性。我们的发现建立了一个可复现的框架,用于诊断和缓解夸大拒绝,突显了实现更安全、更有帮助的 LLM 部署的实际路径。

关键词

引用

@article{arxiv.2510.08158,
  title  = {Beyond Over-Refusal: Scenario-Based Diagnostics and Post-Hoc Mitigation for Exaggerated Refusals in LLMs},
  author = {Shuzhou Yuan and Ercong Nie and Yinuo Sun and Chenxuan Zhao and William LaCroix and Michael Färber},
  journal= {arXiv preprint arXiv:2510.08158},
  year   = {2025}
}