中文

前沿大语言模型内部安全崩溃

计算与语言 2026-03-26 v1 人工智能 密码学与安全

摘要

本工作识别了前沿大语言模型(LLM)中的一种关键失效模式,称为内部安全崩溃(Internal Safety Collapse, ISC):在特定任务条件下,模型进入持续生成有害内容的状态,同时执行其他看似良性的任务。我们引入了 TVD(Task, Validator, Data)框架,通过生成有害内容是唯一有效完成方式的领域任务来触发 ISC,构建了包含 53 个场景的 ISC-Bench,涵盖 8 个专业领域。在 JailbreakBench 上评估,三个代表性场景使四个前沿 LLM(包括 GPT-5.2 和 Claude Sonnet 4.5)的安全失效率平均达到 95.3%,显著高于标准越狱攻击。前沿模型比早期 LLM 更易受攻击:那些使复杂任务执行成为可能的能力,反而在任务本质上涉及有害内容时成为潜在风险。这揭示了日益扩大的攻击面:几乎所有专业领域都使用处理敏感数据的工具,每个新的双用途工具都会自动扩大这一漏洞——即使没有任何蓄意的攻击。尽管已有大量对齐努力,前沿 LLM 仍保留内在的不安全能力:对齐改变可观察的输出,但并未消除 underlying risk profile。这些发现凸显了在高风险场景中部署 LLM 的必要谨慎。源码:https://github.com/wuyoscar/ISC-Bench

关键词

引用

@article{arxiv.2603.23509,
  title  = {Internal Safety Collapse in Frontier Large Language Models},
  author = {Yutao Wu and Xiao Liu and Yifeng Gao and Xiang Zheng and Hanxun Huang and Yige Li and Cong Wang and Bo Li and Xingjun Ma and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2603.23509},
  year   = {2026}
}

备注

15 pages of the main text, qualitative examples of jailbreaks may be harmful in nature