FalseReject:用于改进上下文安全性并缓解 LLM 过度拒绝的结构化推理资源
计算与语言
2025-07-16 v2 人工智能
摘要
大型语言模型 (LLM) 的安全对齐方法常常导致对良性查询的过度拒绝,显著削弱其在敏感场景中的实用性。为解决这一挑战,我们引入了 FalseReject,一个包含 16k 看似有毒查询的综合资源,涵盖 44 个与安全相关的类别,并附带结构化响应。我们提出了一种基于图的对抗性多智能体交互框架,用于生成多样且复杂的查询,同时通过显式推理结构化响应,以帮助模型准确区分安全与不安全的上下文。FalseReject 包括针对标准指令调校模型和面向推理模型的训练数据集,以及人工标注的基准测试集。我们对 29 项最先进 (SOTA) LLM 进行了广泛基准测试,揭示了持续的过度拒绝挑战。实证结果表明,使用 FalseReject 进行监督微调可显著降低不必要的拒绝,而不会损害整体安全或通用语言能力。
引用
@article{arxiv.2505.08054,
title = {FalseReject: A Resource for Improving Contextual Safety and Mitigating Over-Refusals in LLMs via Structured Reasoning},
author = {Zhehao Zhang and Weijie Xu and Fanyou Wu and Chandan K. Reddy},
journal= {arXiv preprint arXiv:2505.08054},
year = {2025}
}
备注
Accepted at COLM 2025