中文

AI 公司应报告缓解前与缓解后的安全评估

计算机与社会 2025-03-25 v1 人工智能 机器学习

摘要

人工智能系统的快速发展引发了人们对前沿 AI 系统潜在危害以及负责任评估与监管需求的广泛关注。在这篇立场论文中,我们主张前沿 AI 公司应同时报告缓解前与缓解后的安全评估结果,以支持基于充分信息的政策决策。在两个阶段对模型进行评估,可为政策制定者提供关键证据,用于规范部署、访问与安全标准。我们证明,单独依赖任一阶段的评估都会对模型安全性形成误导性认知。通过对主要前沿实验室 AI 安全披露的分析,我们识别出三个关键缺口:(1)公司很少同时评估缓解前与缓解后的版本;(2)评估方法缺乏标准化;(3)所报告的结果往往过于模糊,无法为政策提供依据。为解决这些问题,我们建议向经批准的政府机构强制披露缓解前与缓解后的能力评估结果,推行标准化的评估方法,并对公开安全报告设定最低透明度要求。这些措施可确保政策制定者与监管机构能够制定有针对性的安全措施、评估部署风险,并有效审视公司的安全声明。

关键词

引用

@article{arxiv.2503.17388,
  title  = {AI Companies Should Report Pre- and Post-Mitigation Safety Evaluations},
  author = {Dillon Bowen and Ann-Kathrin Dombrowski and Adam Gleave and Chris Cundy},
  journal= {arXiv preprint arXiv:2503.17388},
  year   = {2025}
}