映射AI风险缓解措施:证据扫描与初步AI风险缓解分类法
计算机与社会
2025-12-16 v1 人工智能
摘要
开发、部署、使用和治理AI的组织与政府必须就有效的风险缓解措施进行协调。然而,AI风险缓解框架的格局是碎片化的,使用了不一致的术语,并且在覆盖范围上存在空白。本文引入了一个初步的AI风险缓解分类法,用于组织AI风险缓解措施并提供共同的参考框架。该分类法是通过对2023-2025年间发布的13个AI风险缓解框架进行快速证据扫描而开发的,这些框架被提取到一个包含831个AI风险缓解措施的动态数据库中。这些缓解措施经过迭代聚类和编码以创建分类法。初步的AI风险缓解分类法将缓解措施组织为四个类别和23个子类别:(1) 治理与监督:建立人工监督机制和决策协议的正式组织结构和政策框架;(2) 技术与安全:保护AI系统并约束模型行为的技术、物理和工程保障措施;(3) 运营流程:管理AI系统部署、使用、监控、事件处理和验证的流程和管理框架;(4) 透明度与问责制:传达AI系统信息并使外部审查成为可能的正式披露实践和验证机制。快速证据扫描和分类法构建还揭示了一些案例,其中像"风险管理"和"红队测试"这样的术语被广泛使用,但指的是不同的责任主体、行动和行动机制来降低风险。该分类法及相关缓解数据库虽然初步,但为AI风险缓解措施的汇总和综合提供了一个起点。它还为AI生态系统中的不同参与者提供了一种可访问的、结构化的方式来讨论和协调行动以降低AI带来的风险。
引用
@article{arxiv.2512.11931,
title = {Mapping AI Risk Mitigations: Evidence Scan and Preliminary AI Risk Mitigation Taxonomy},
author = {Alexander K. Saeri and Sophia Lloyd George and Jess Graham and Clelia D. Lacarriere and Peter Slattery and Michael Noetel and Neil Thompson},
journal= {arXiv preprint arXiv:2512.11931},
year = {2025}
}
备注
Access AI Risk Mitigation Database and Taxonomy at https://airisk.mit.edu