从安全决策边界揭示视角理解与缓解 LLM 中的过度拒绝
人工智能
2025-09-18 v3 机器学习
摘要
大语言模型(LLMs)在广泛的任务中展现了显著能力,但它们经常拒绝回答合理的查询——这一现象被称为过度拒绝。过度拒绝通常源于过度保守的安全对齐,导致模型将许多合理提示视为潜在风险。为了系统地理解这一问题,我们探测并利用模型的安全决策边界来分析和缓解过度拒绝。我们的发现揭示过度拒绝与这些边界区域的错位密切相关,模型在这些区域难以区分良性内容与有害内容之间的细微差异。基于这些见解,我们提出了 RASS,一个用于提示生成与选择的自动化框架,它策略性地针对安全边界附近的过度拒绝提示。通过利用表示空间中的引导向量,RASS 高效地识别并筛选边界对齐的提示,实现对过度拒绝的更有效和更有针对性的缓解。该方法不仅提供了对模型安全决策更精确和可解释的视角,还无缝扩展至多语言场景。我们探索了各种 LLMs 的安全决策边界,并构建了 MORBench 评估集,以促进对模型安全性和有用性的跨语言稳健评估。代码和数据集可在 https://github.com/Master-PLC/RASS 获取。
引用
@article{arxiv.2505.18325,
title = {Understanding and Mitigating Overrefusal in LLMs from an Unveiling Perspective of Safety Decision Boundary},
author = {Licheng Pan and Yongqi Tong and Xin Zhang and Xiaolu Zhang and Jun Zhou and Zhixuan Chu},
journal= {arXiv preprint arXiv:2505.18325},
year = {2025}
}