中文

FalseReject:用于改进上下文安全性并缓解 LLM 过度拒绝的结构化推理资源

计算与语言 2025-07-16 v2 人工智能

摘要

大型语言模型 (LLM) 的安全对齐方法常常导致对良性查询的过度拒绝,显著削弱其在敏感场景中的实用性。为解决这一挑战,我们引入了 FalseReject,一个包含 16k 看似有毒查询的综合资源,涵盖 44 个与安全相关的类别,并附带结构化响应。我们提出了一种基于图的对抗性多智能体交互框架,用于生成多样且复杂的查询,同时通过显式推理结构化响应,以帮助模型准确区分安全与不安全的上下文。FalseReject 包括针对标准指令调校模型和面向推理模型的训练数据集,以及人工标注的基准测试集。我们对 29 项最先进 (SOTA) LLM 进行了广泛基准测试,揭示了持续的过度拒绝挑战。实证结果表明,使用 FalseReject 进行监督微调可显著降低不必要的拒绝,而不会损害整体安全或通用语言能力。

关键词

引用

@article{arxiv.2505.08054,
  title  = {FalseReject: A Resource for Improving Contextual Safety and Mitigating Over-Refusals in LLMs via Structured Reasoning},
  author = {Zhehao Zhang and Weijie Xu and Fanyou Wu and Chandan K. Reddy},
  journal= {arXiv preprint arXiv:2505.08054},
  year   = {2025}
}

备注

Accepted at COLM 2025