中文

SafetyPrompts:用于评估和改进大型语言模型安全性的开放数据集系统性综述

计算与语言 2025-01-13 v2 人工智能

摘要

过去两年中,对大型语言模型 (LLM) 安全性的担忧迅速增长。研究人员和从业者通过创建大量用于评估和改进 LLM 安全性的数据集来应对这些担忧。然而,这些工作大部分是并行进行的,且目标大相径庭,从缓解围绕偏见和有毒内容生成的近期风险,到评估长期的灾难性风险潜力。这使得研究人员和从业者难以找到最适合其用例的数据集,并难以识别未来工作可能填补的数据集覆盖空白。为了弥补这些问题,我们对用于评估和改进 LLM 安全性的开放数据集进行了首次系统性综述。我们审查了 144 个数据集,这些数据集是在几个月的时间里通过迭代和社区驱动的过程确定的。我们强调了模式和趋势,例如向完全合成数据集发展的趋势,以及数据集覆盖的空白,例如明显缺乏非英语和自然主义数据集。我们还研究了 LLM 安全数据集在实践中的使用情况——在 LLM 发布出版物和流行的 LLM 基准测试中——发现当前的评估实践高度个性化,且仅使用了可用数据集的一小部分。我们的贡献基于 SafetyPrompts.com,这是一个用于 LLM 安全性的开放数据集动态目录,我们计划随着 LLM 安全性领域的发展不断更新它。

关键词

引用

@article{arxiv.2404.05399,
  title  = {SafetyPrompts: a Systematic Review of Open Datasets for Evaluating and Improving Large Language Model Safety},
  author = {Paul Röttger and Fabio Pernisi and Bertie Vidgen and Dirk Hovy},
  journal= {arXiv preprint arXiv:2404.05399},
  year   = {2025}
}

备注

Accepted at AAAI 2025 (Special Track on AI Alignment)