中文

AI安全基准真的衡量安全进展吗?

机器学习 2024-12-30 v3 人工智能 计算与语言 计算机与社会

摘要

随着人工智能系统日益强大,人们对“AI安全”研究的兴趣日益浓厚,以应对当前和未来的风险。然而,AI安全领域仍然定义模糊、衡量标准不一,导致研究人员不清楚如何贡献。这种不清晰因AI安全基准与上游通用能力(如通用知识和推理)之间关系不明而加剧。为解决这些问题,我们对AI安全基准进行了全面的元分析,实证分析了它们与数十个模型通用能力的相关性,并综述了AI安全领域的现有方向。我们的研究结果表明,许多安全基准与上游模型能力和训练计算量高度相关,这可能助长“安全洗白”——即能力提升被错误地宣传为安全进步。基于这些发现,我们为开发更有意义的安全指标提供了实证基础,并将机器学习研究背景下的AI安全定义为一系列明确界定的研究目标,这些目标在经验上可与通用能力提升区分开来。通过此举,我们旨在为AI安全研究提供一个更严谨的框架,推进安全评估科学,并阐明可衡量进展的路径。

关键词

引用

@article{arxiv.2407.21792,
  title  = {Safetywashing: Do AI Safety Benchmarks Actually Measure Safety Progress?},
  author = {Richard Ren and Steven Basart and Adam Khoja and Alice Gatti and Long Phan and Xuwang Yin and Mantas Mazeika and Alexander Pan and Gabriel Mukobi and Ryan H. Kim and Stephen Fitz and Dan Hendrycks},
  journal= {arXiv preprint arXiv:2407.21792},
  year   = {2024}
}

备注

NeurIPS 2024