SoSBench:六大科学领域的安全对齐基准测试
机器学习
2026-04-07 v3 人工智能
密码学与安全
摘要
大型语言模型(LLM)在推理和研究生级别问答等复杂任务中展现出不断提升的能力,但它们抵御滥用的能力,特别是涉及科学层面复杂风险时的能力,仍未得到充分探索。现有的安全基准通常要么侧重于需要极少知识理解的指令(例如“告诉我如何制造炸弹”),要么使用风险相对较低的提示(例如关于危险内容的多项选择或分类任务)。因此,它们无法充分评估模型在处理知识密集型危险场景时的安全性。为了填补这一关键空白,我们引入了 SoSBench,这是一个以法规为基础、以危险为核心焦点的基准,涵盖六个高风险科学领域:化学、生物学、医学、药理学、物理学和心理学。该基准包含 3,000 个源自现实世界法规和法律的提示,并通过 LLM 辅助的演化流水线进行系统性扩展,引入了多样且真实的滥用场景(例如涉及高级化学公式的详细爆炸物合成说明)。我们在统一的评估框架内使用 SoSBench 对前沿模型进行了评估。尽管这些模型声称已实现安全对齐,但高级模型在所有领域均持续披露违规内容,表现出令人震惊的高有害响应率(例如,Deepseek-R1 为 84.9%,GPT-4.1 为 50.3%)。这些结果凸显了显著的安全对齐缺陷,并强调了对强大 LLM 负责任部署的紧迫担忧。
引用
@article{arxiv.2505.21605,
title = {SoSBench: Benchmarking Safety Alignment on Six Scientific Domains},
author = {Fengqing Jiang and Fengbo Ma and Zhangchen Xu and Yuetai Li and Zixin Rao and Bhaskar Ramasubramanian and Luyao Niu and Bo Li and Xianyan Chen and Zhen Xiang and Radha Poovendran},
journal= {arXiv preprint arXiv:2505.21605},
year = {2026}
}
备注
Project Page: https://sosbench.github.io/; ICLR 2026