中文

内部评估尚不充分:迈向面向通用人工智能的稳健第三方缺陷披露

人工智能 2025-03-26 v2

摘要

通用人工智能(GPAI)系统的广泛部署引入了显著的新风险。然而,用于报告 GPAI 系统缺陷的基础设施、实践与规范仍严重滞后,远不及软件安全等更为成熟的领域。基于软件安全、机器学习、法学、社会科学和政策等领域专家的合作,我们识别了 GPAI 系统缺陷评估与报告方面的关键差距。我们呼吁采取三项干预措施以推进系统安全。第一,我们建议使用标准化的 AI 缺陷报告以及面向研究者的参与规则,以简化 GPAI 系统缺陷的提交、复现与分类流程。第二,我们建议 GPAI 系统提供商采用范围广泛的缺陷披露计划,借鉴漏洞悬赏机制,并设立法律安全港以保护研究者。第三,我们倡导建设更完善的基础设施,以协调缺陷报告在可能受影响的众多利益相关方之间的分发。这些干预措施日益迫切,因为越狱攻击及其他可在不同提供商的 GPAI 系统间迁移的缺陷屡见不鲜。通过推动 AI 生态系统中稳健的报告与协调机制,这些提议有望显著提升 GPAI 系统的安全性、安保性与问责性。

关键词

引用

@article{arxiv.2503.16861,
  title  = {In-House Evaluation Is Not Enough: Towards Robust Third-Party Flaw Disclosure for General-Purpose AI},
  author = {Shayne Longpre and Kevin Klyman and Ruth E. Appel and Sayash Kapoor and Rishi Bommasani and Michelle Sahar and Sean McGregor and Avijit Ghosh and Borhane Blili-Hamelin and Nathan Butters and Alondra Nelson and Amit Elazari and Andrew Sellars and Casey John Ellis and Dane Sherrets and Dawn Song and Harley Geiger and Ilona Cohen and Lauren McIlvenny and Madhulika Srikumar and Mark M. Jaycox and Markus Anderljung and Nadine Farid Johnson and Nicholas Carlini and Nicolas Miailhe and Nik Marda and Peter Henderson and Rebecca S. Portnoff and Rebecca Weiss and Victoria Westerhoff and Yacine Jernite and Rumman Chowdhury and Percy Liang and Arvind Narayanan},
  journal= {arXiv preprint arXiv:2503.16861},
  year   = {2025}
}