中文

AIR-Bench 2024:基于法规与政策风险类别的安全基准

计算机与社会 2024-08-07 v2 人工智能

摘要

基础模型(FMs)带来社会效益,同时也放大了风险。政府、企业和研究者已提出监管框架、可接受使用政策和安全基准以作出回应。然而,现有的公共基准通常基于先前文献、直觉或常识定义安全类别,导致根据最新法规和政策中指定的风险类别形成的类别集合不连贯,这使得在这些基准之间评估和比较FMs具有挑战性。为弥合这一差距,我们介绍AIR-Bench 2024,首个与新兴政府法规和公司政策相吻合的AI安全基准,遵循基于我们AI风险研究(AIR 2024)所确立的法规驱动安全类别。AIR 2024将8项政府法规和16项公司政策分解为四层级安全分类体系,其中最低层级包含314个细粒度风险类别。AIR-Bench 2024包含5,694个跨越这些类别的多样化提示,经过手动筛选和人工审计以确保质量。我们对领先语言模型在AIR-Bench 2024上的表现进行评估,揭示了其与指定安全关切的对齐情况。通过弥合公共基准与实际AI风险之间的差距,AIR-Bench 2024为跨司法管辖区评估模型安全提供了基础,促进开发更安全、更负责任的AI系统。

关键词

引用

@article{arxiv.2407.17436,
  title  = {AIR-Bench 2024: A Safety Benchmark Based on Risk Categories from Regulations and Policies},
  author = {Yi Zeng and Yu Yang and Andy Zhou and Jeffrey Ziwei Tan and Yuheng Tu and Yifan Mai and Kevin Klyman and Minzhou Pan and Ruoxi Jia and Dawn Song and Percy Liang and Bo Li},
  journal= {arXiv preprint arXiv:2407.17436},
  year   = {2024}
}