在检索增强生成中引导过度拒绝走向安全
计算与语言
2025-10-14 v1
摘要
大型语言模型(LLM)的安全对齐会导致过度拒绝——即LLM由于激进的安全过滤器而拒绝良性请求。我们分析了检索增强生成(RAG)中的这一现象,其中查询意图和检索到的上下文属性都会影响拒绝行为。我们构建了RagRefuse,一个涵盖医学、化学和开放领域的领域分层基准,将良性和有害查询与受控的上下文污染模式和大小配对。我们的分析表明,上下文排列/污染、查询和上下文的领域以及有害文本密度会触发对良性查询的拒绝,其效果取决于模型特定的对齐选择。为了缓解过度拒绝,我们引入了SafeRAG-Steering,一种以模型为中心的嵌入干预方法,在推理时将嵌入区域引导至已确认的安全、非拒绝输出区域。这减少了受污染RAG流水线中的过度拒绝,同时保留了合理的拒绝。
引用
@article{arxiv.2510.10452,
title = {Steering Over-refusals Towards Safety in Retrieval Augmented Generation},
author = {Utsav Maskey and Mark Dras and Usman Naseem},
journal= {arXiv preprint arXiv:2510.10452},
year = {2025}
}
备注
Preprint