RefusalBench:为何拒绝率误排名生物研究提示下的前沿大语言模型
摘要
前沿大语言模型日益被部署作为生物研究工作流程的编排背板,但目前没有共享的证据基础用于比较其在合法研究提示上的拒绝行为。本文介绍 RefusalBench,这是一个包含 141 个提示的匹配三元基准,包含 47 个捆绑包,保持任务框架不变,仅变更生物风险层级(良性、含糊、双用途),从而实现基于层级的条件比较,抗制子领域混淆。15 个提示的正面控制模块建立了每个模型的拒绝校准底线;三个模型甚至未对这些提示进行拒绝。在 19 个前沿模型的 2026 年 5 月快照中,严格拒绝率在相同的提示上跨越 0.1% 到 94.6%。司法管辖区不预测该快照中的拒绝(Mann-Whitney U, p = 0.393;EU n = 1,US 双峰分布);但提供商身份确实预测拒绝率,在模型聚类情形下 OR = 21.03(95% CI: 14.58-30.34 提示-聚类;5.70-77.55 在模型-聚类 GEE 下)。这种效应最好读作访问路径层面而非模型权重层面:99.8% 的 Anthropic 的严格拒绝携带相同的 safety_policy 仲裁原因代码,这与一小组标准化拒绝模板相符,而非基于案件的模型推理。严格拒绝率误排名安全校准:Grok 4.20 在 tier 差别辨识上取得最佳成绩(Youden's J = 0.787),但仅按总体拒绝率排名第七;Claude Opus 4.7 的 J 从前一版本下降 65%,且未在双用途检测方面取得改进。九个在 18 个前沿模型中 exhibit hedge-but-help 部分合规模式于双用途 tier,这种二元拒绝指标无法检测。
引用
@article{arxiv.2605.21545,
title = {RefusalBench: Why Refusal Rate Misranks Frontier LLMs on Biological Research Prompts},
author = {Lukas Weidener and Marko Brkić and Mihailo Jovanović and Emre Ulgac and Aakaash Meduri},
journal= {arXiv preprint arXiv:2605.21545},
year = {2026}
}
备注
34 pages, 4 figures, 12 tables (10 in main text, 2 in supplementary). Code and data: https://github.com/AppliedScientific/refusalbench