AILuminate:来自 MLCommons 的 AI 风险与可靠性基准 v1.0 介绍
计算机与社会
2025-04-22 v2 人工智能
摘要
AI 系统的快速进步和部署创造了对标准安全评估框架的迫切需求。本文介绍了 AILuminate v1.0,这是首个用于评估 AI 产品风险和可靠性的全面行业标准基准。其开发采用了一个开放的过程,包括来自多个领域的参与者。该基准评估 AI 系统对旨在诱发危险、非法或不良行为的提示的抵抗力,涵盖 12 个危害类别,包括暴力犯罪、非暴力犯罪、性相关犯罪、儿童性剥削、无差别武器、自杀和自残、知识产权、隐私、诽谤、仇恨、色情内容以及专业建议(选举、金融、健康、法律)。我们的方法包含完整的评估标准、广泛的提示数据集、新颖的评估框架、评分和报告系统,以及用于长期支持和演进的技术与组织基础设施。特别是,该基准采用易于理解的五级评分标准(从差到优秀),并纳入了创新的基于熵的系统响应评估。除了公布该基准外,本报告还指出了我们的方法以及构建安全基准普遍存在的局限性,包括评估者的不确定性和单轮交互的约束。这项工作代表了在建立 AI 风险和可靠性评估全球标准方面迈出的关键一步,同时承认在多轮交互、多模态理解、覆盖其他语言以及新兴危害类别等领域需要继续发展。我们的研究结果为致力于促进更安全的 AI 部署的模型开发者、系统集成商和政策制定者提供了有价值的见解。
引用
@article{arxiv.2503.05731,
title = {AILuminate: Introducing v1.0 of the AI Risk and Reliability Benchmark from MLCommons},
author = {Shaona Ghosh and Heather Frase and Adina Williams and Sarah Luger and Paul Röttger and Fazl Barez and Sean McGregor and Kenneth Fricklas and Mala Kumar and Quentin Feuillade--Montixi and Kurt Bollacker and Felix Friedrich and Ryan Tsang and Bertie Vidgen and Alicia Parrish and Chris Knotz and Eleonora Presani and Jonathan Bennion and Marisa Ferrara Boston and Mike Kuniavsky and Wiebke Hutiri and James Ezick and Malek Ben Salem and Rajat Sahay and Sujata Goswami and Usman Gohar and Ben Huang and Supheakmungkol Sarin and Elie Alhajjar and Canyu Chen and Roman Eng and Kashyap Ramanandula Manjusha and Virendra Mehta and Eileen Long and Murali Emani and Natan Vidra and Benjamin Rukundo and Abolfazl Shahbazi and Kongtao Chen and Rajat Ghosh and Vithursan Thangarasa and Pierre Peigné and Abhinav Singh and Max Bartolo and Satyapriya Krishna and Mubashara Akhtar and Rafael Gold and Cody Coleman and Luis Oala and Vassil Tashev and Joseph Marvin Imperial and Amy Russ and Sasidhar Kunapuli and Nicolas Miailhe and Julien Delaunay and Bhaktipriya Radharapu and Rajat Shinde and Tuesday and Debojyoti Dutta and Declan Grabb and Ananya Gangavarapu and Saurav Sahay and Agasthya Gangavarapu and Patrick Schramowski and Stephen Singam and Tom David and Xudong Han and Priyanka Mary Mammen and Tarunima Prabhakar and Venelin Kovatchev and Rebecca Weiss and Ahmed Ahmed and Kelvin N. Manyeki and Sandeep Madireddy and Foutse Khomh and Fedor Zhdanov and Joachim Baumann and Nina Vasan and Xianjun Yang and Carlos Mougn and Jibin Rajan Varghese and Hussain Chinoy and Seshakrishna Jitendar and Manil Maskey and Claire V. Hardgrove and Tianhao Li and Aakash Gupta and Emil Joswin and Yifan Mai and Shachi H Kumar and Cigdem Patlak and Kevin Lu and Vincent Alessi and Sree Bhargavi Balija and Chenhe Gu and Robert Sullivan and James Gealy and Matt Lavrisa and James Goel and Peter Mattson and Percy Liang and Joaquin Vanschoren},
journal= {arXiv preprint arXiv:2503.05731},
year = {2025}
}
备注
51 pages, 8 figures and an appendix