中文

前沿模型的 CBRN 风险量化

密码学与安全 2025-10-27 v1 人工智能

摘要

前沿大语言模型 (LLM) 因其可能导致化学、生物、放射性和核 (CBRN) 武器知识的扩散,面临前所未有的双用途风险。我们评估了 10 种主流商业 LLM 对新构建的 200 题 CBRN 数据集以及 180 题 FORTRESS 数据集子集的安全表现,采用严格的三级攻击方法。我们的发现揭示了关键安全漏洞:Deep Inception 攻击成功率达 86.0%,而直接请求仅为 33.8%,表明过滤机制仅能有效阻挡表面化攻击;模型安全表现差异显著,成功率从 2% (claude-opus-4) 达到 96% (mistral-small-latest);八个模型在被要求提升危险物质性质时,脆弱性超过 70%。我们识别出当前安全对齐存在的根本脆弱性,简单提示工程技术即可绕过安全措施获取危险 CBRN 信息。这些结果挑战了行业的安全主张,凸显亟需标准化评估框架、透明的安全指标以及更稳健的对齐技术,以在保留有益能力的同时遏制灾难性滥用风险。

关键词

引用

@article{arxiv.2510.21133,
  title  = {Quantifying CBRN Risk in Frontier Models},
  author = {Divyanshu Kumar and Nitin Aravind Birur and Tanay Baswa and Sahil Agarwal and Prashanth Harshangi},
  journal= {arXiv preprint arXiv:2510.21133},
  year   = {2025}
}