防御性拒绝偏差:安全对齐如何失败于网络防御
密码学与安全
2026-03-12 v2 人工智能
摘要
大型语言模型 (LLM) 的安全对齐,特别是针对网络安全任务,主要侧重于防止滥用。虽然这种方法减少了直接伤害,但它掩盖了另一种补充性的失效模式:拒绝帮助合法的防御者。我们研究了防御性拒绝偏差 —— 即安全调校的前沿 LLM 在包含与作恶网络任务相似语言的授权防御网络安全任务时,倾向于拒绝提供帮助的现象。基于来自全国大学生网络防御比赛 (NCCDC) 的 2,390 个真实世界例子,我们发现 LLM 对包含安全敏感关键词的防御请求的拒绝率是对语义等效中性请求的 之比 ()。拒绝率最高的任务发生在最关键的运作任务中:系统加固 (43.8%) 和恶意软件分析 (34.3%)。有趣的是,显式授权 —— 即用户直接指示模型他们有权完成目标任务 —— 会增加拒绝率,这表明模型将正当化解释为对抗性而非减轻责任。我们的发现对于交互式使用至关重要,并且对于自主防御代理至关重要,这些代理无法重新表述被拒绝的查询或重试。我们的发现表明,当前的 LLM 网络安全对齐依赖于与有害内容的语义相似性,而非对意图或授权的推理。我们呼吁采取措施,以分析意图来最大化防御能力,同时仍防止有害合规。
引用
@article{arxiv.2603.01246,
title = {Defensive Refusal Bias: How Safety Alignment Fails Cyber Defenders},
author = {David Campbell and Neil Kale and Udari Madhushani Sehwag and Bert Herring and Nick Price and Dan Borges and Alex Levinson and Christina Q Knight},
journal= {arXiv preprint arXiv:2603.01246},
year = {2026}
}