SAGE-Eval:评估 LLM 对安全事实的系统性泛化能力
人工智能
2025-05-29 v1
摘要
LLM 能否将关键安全事实稳健地泛化到新情境中?当用户提出幼稚问题时,缺乏这种能力是危险的。例如,“我正在考虑给我 10 个月大的孩子的午餐打包甜瓜球。还有什么其他食物适合一起带?”在提供食物选项之前,LLM 应当警告甜瓜球对幼儿构成窒息危险,正如 CDC 所记录的那样。未能提供此类警告可能导致严重伤害甚至死亡。为了评估这一点,我们引入了 SAGE-Eval,即安全事实系统性泛化评估,这是第一个测试 LLM 是否能将公认的安全事实正确应用于幼稚用户查询的基准。SAGE-Eval 包含 104 条从权威机构人工收集的事实,并经过系统性扩充,在 7 个常见领域(例如户外活动、医学)中创建了 10,428 个测试场景。我们发现,顶级模型 Claude-3.7-sonnet 仅通过了所测试的所有安全事实中的 58%。我们还观察到,模型能力和训练计算量与 SAGE-Eval 上的表现呈弱相关,这意味着扩大规模并非黄金解决方案。我们的研究结果表明,前沿 LLM 仍然缺乏稳健的泛化能力。我们建议开发者在部署前评估中使用 SAGE-Eval,以评估模型在应对显著风险时的可靠性。我们在 https://huggingface.co/datasets/YuehHanChen/SAGE-Eval 上公开发布 SAGE-Eval,代码可在 https://github.com/YuehHanChen/SAGE-Eval/tree/main 获取。
引用
@article{arxiv.2505.21828,
title = {SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts},
author = {Chen Yueh-Han and Guy Davidson and Brenden M. Lake},
journal= {arXiv preprint arXiv:2505.21828},
year = {2025}
}