中文

盲目拒绝:语言模型拒绝帮助用户规避不公正、荒谬和不合法的规则

人工智能 2026-04-09 v1

摘要

经过安全训练的语言模型 routinely refuse requests for help circumventing rules。但并非所有规则都值得遵守。当用户请求帮助规避由不合法权威制定的规则、在内容或适用上 deeply unjust 或 absurd 的规则,或允许合理例外情况的规则时,拒绝是道德推理的失败。我们介绍了记录这种拒绝模式的实证结果,我们称之为盲目拒绝:语言模型在不考虑底层规则是否可辩护的情况下,拒绝帮助打破规则的请求。我们的数据集包含跨越 5 种失效类别(规则可被打破的原因)和 19 种权威类型的合成案例,经过三个自动化质量门和人工审查验证。我们收集了来自 7 个模型族共 18 种模型配置的响应,并在两个行为维度上对其分类——响应类型(帮助、硬拒绝或转移)以及模型是否识别出削弱规则合规性主张的原因——使用盲审 GPT-5.4 LLM-as-judge 评估。我们发现模型拒绝了 75.4%(N=14,650)的失效规则请求,即使请求不涉及独立的安全或双用途问题。我们还发现模型在大多数情况(57.5%)下会处理失效条件,但无论如何都拒绝帮助——表明模型的拒绝行为与其对规则合法性的规范推理能力是脱钩的。

关键词

引用

@article{arxiv.2604.06233,
  title  = {Blind Refusal: Language Models Refuse to Help Users Evade Unjust, Absurd, and Illegitimate Rules},
  author = {Cameron Pattison and Lorenzo Manuali and Seth Lazar},
  journal= {arXiv preprint arXiv:2604.06233},
  year   = {2026}
}

备注

9 pages body text, 38 pages total, 4 figures