EVOREFUSE:面向 LLM 对伪恶意指令过度拒绝的评估与缓解的进化提示优化
人工智能
2026-01-21 v3
摘要
大型语言模型(LLM)经常拒绝回应伪恶意指令:即由于保守的安全对齐而触发不必要的 LLM 拒绝的语义无害输入查询,这极大损害了用户体验。收集此类指令对于评估和缓解过度拒绝至关重要,但现有的指令筛选方法(如人工创建或指令重写)要么缺乏可扩展性,要么无法生成足够多样且有效的引发拒绝的提示。为了解决这些局限性,我们引入了 EVOREFUSE,这是一种提示优化方法,能够生成多样化的伪恶意指令,并在不同 LLM 中持续引发确信的拒绝。EVOREFUSE 采用进化算法,通过变异策略和重组,以比现有方法更多样化的方向探索指令空间,并迭代演化种子指令,以最大化 LLM 拒绝概率的证据下界。使用 EVOREFUSE,我们创建了两个新数据集:EVOREFUSE-TEST,一个包含 582 条伪恶意指令的基准,在无安全先验系统提示下,其在 9 个 LLM 上的平均触发拒绝率比次优基准高 85.34%,词汇多样性高 34.86%,LLM 响应置信度得分提升 40.03%;以及 EVOREFUSE-ALIGN,提供 3000 条带有响应的伪恶意指令,用于监督和基于偏好的对齐训练。通过对 EVOREFUSE-ALIGN 进行监督微调,LLAMA3.1-8B-INSTRUCT 的过度拒绝比在次优对齐数据集上训练的模型减少了 29.85%,且未损害安全性。我们使用 EVOREFUSE-TEST 进行的分析表明,模型触发过度拒绝是因为过度关注敏感关键词而忽略了更广泛的上下文。我们的代码和数据集可在 https://github.com/FishT0ucher/EVOREFUSE 获取。
引用
@article{arxiv.2505.23473,
title = {EVOREFUSE: Evolutionary Prompt Optimization for Evaluation and Mitigation of LLM Over-Refusal to Pseudo-Malicious Instructions},
author = {Xiaorui Wu and Fei Li and Xiaofeng Mao and Xin Zhang and Li Zheng and Yuxiang Peng and Chong Teng and Donghong Ji and Zhuang Li},
journal= {arXiv preprint arXiv:2505.23473},
year = {2026}
}
备注
NeurIPS 2025