中文

在检索增强生成中引导过度拒绝走向安全

计算与语言 2025-10-14 v1

摘要

大型语言模型(LLM)的安全对齐会导致过度拒绝——即LLM由于激进的安全过滤器而拒绝良性请求。我们分析了检索增强生成(RAG)中的这一现象,其中查询意图和检索到的上下文属性都会影响拒绝行为。我们构建了RagRefuse,一个涵盖医学、化学和开放领域的领域分层基准,将良性和有害查询与受控的上下文污染模式和大小配对。我们的分析表明,上下文排列/污染、查询和上下文的领域以及有害文本密度会触发对良性查询的拒绝,其效果取决于模型特定的对齐选择。为了缓解过度拒绝,我们引入了SafeRAG-Steering,一种以模型为中心的嵌入干预方法,在推理时将嵌入区域引导至已确认的安全、非拒绝输出区域。这减少了受污染RAG流水线中的过度拒绝,同时保留了合理的拒绝。

关键词

引用

@article{arxiv.2510.10452,
  title  = {Steering Over-refusals Towards Safety in Retrieval Augmented Generation},
  author = {Utsav Maskey and Mark Dras and Usman Naseem},
  journal= {arXiv preprint arXiv:2510.10452},
  year   = {2025}
}

备注

Preprint