中文

FORTRESS:面向国家安全与公共安全的前沿风险评估

计算机与社会 2025-06-26 v2 机器学习

摘要

大型语言模型 (LLM) 的快速发展带来双重用途能力,既可能威胁也可能增强国家安全与公共安全 (NSPS)。模型实施了保护措施,以防止潜在的 NSPS 误用,同时允许良好用户获得有用的信息。然而,当前的基准测试往往未能以客观、稳健的方式测试保护措施对潜在 NSPS 风险的鲁棒性。我们引入 FORTRESS:500 个专家精选的对抗性提示,搭配 4-7 个二元问题的实例评估标准,用于自动化评估 3 大领域(仅限未分级信息):化学、生物、放射、核与爆炸 (CBRNE)、政治暴力与恐怖主义,以及刑事与金融非法活动,涵盖 10 个子类别。每组提示-评估标准均对应一组良好版本,以测试模型的过度拒绝情况。该评估揭示了前沿 LLM 保护措施鲁棒性在潜在风险与模型实用性之间的差异:Claude-3.5-Sonnet 显示出低平均风险得分 (ARS) (100 分制下 14.09) 但最高的过度拒绝得分 (ORS) (100 分制下 21.8),而 Gemini 2.5 Pro 表现出低过度拒绝 (1.4) 但高的潜在风险 (66.29)。Deepseek-R1 的 ARS 最高达 78.05,但 ORS 最低仅为 0.06。诸如 o1 之类的模型在潜在风险与过度拒绝之间呈现更均衡的权衡(ARS 为 21.69,ORS 为 5.2)。为帮助决策者和研究者清晰理解模型的潜在风险,我们公开发布 FORTRESS 数据集于 https://huggingface.co/datasets/ScaleAI/fortress_public。我们亦维护一套私有数据集用于评估。

关键词

引用

@article{arxiv.2506.14922,
  title  = {FORTRESS: Frontier Risk Evaluation for National Security and Public Safety},
  author = {Christina Q. Knight and Kaustubh Deshpande and Ved Sirdeshmukh and Meher Mankikar and Scale Red Team and SEAL Research Team and Julian Michael},
  journal= {arXiv preprint arXiv:2506.14922},
  year   = {2025}
}

备注

12 pages, 7 figures, submitted to NeurIPS