SafetyPrompts:用于评估和改进大型语言模型安全性的开放数据集系统性综述
计算与语言
2025-01-13 v2 人工智能
摘要
过去两年中,对大型语言模型 (LLM) 安全性的担忧迅速增长。研究人员和从业者通过创建大量用于评估和改进 LLM 安全性的数据集来应对这些担忧。然而,这些工作大部分是并行进行的,且目标大相径庭,从缓解围绕偏见和有毒内容生成的近期风险,到评估长期的灾难性风险潜力。这使得研究人员和从业者难以找到最适合其用例的数据集,并难以识别未来工作可能填补的数据集覆盖空白。为了弥补这些问题,我们对用于评估和改进 LLM 安全性的开放数据集进行了首次系统性综述。我们审查了 144 个数据集,这些数据集是在几个月的时间里通过迭代和社区驱动的过程确定的。我们强调了模式和趋势,例如向完全合成数据集发展的趋势,以及数据集覆盖的空白,例如明显缺乏非英语和自然主义数据集。我们还研究了 LLM 安全数据集在实践中的使用情况——在 LLM 发布出版物和流行的 LLM 基准测试中——发现当前的评估实践高度个性化,且仅使用了可用数据集的一小部分。我们的贡献基于 SafetyPrompts.com,这是一个用于 LLM 安全性的开放数据集动态目录,我们计划随着 LLM 安全性领域的发展不断更新它。
引用
@article{arxiv.2404.05399,
title = {SafetyPrompts: a Systematic Review of Open Datasets for Evaluating and Improving Large Language Model Safety},
author = {Paul Röttger and Fabio Pernisi and Bertie Vidgen and Dirk Hovy},
journal= {arXiv preprint arXiv:2404.05399},
year = {2025}
}
备注
Accepted at AAAI 2025 (Special Track on AI Alignment)