生成式AI的红队测试:银弹或安全戏剧?
计算机与社会
2024-08-29 v3 人机交互
机器学习
摘要
针对生成式AI (GenAI) 模型在安全、安全性和可信度方面的日益增长的担忧,实践者和监管者都指出AI红队测试是其识别和缓解这些风险的关键策略之一。然而,尽管AI红队测试在政策讨论和企业信息宣传中占据核心地位,但关于其具体含义、其在监管中的作用以及其如何与原初于网络安全领域的传统红队实践相关系仍存在诸多疑问。本文我们识别了AI行业最近的红队测试案例,并对相关研究文献进行了广泛调查,以刻画AI红队实践的范围、结构和标准。我们的分析揭示了AI红队实践的先前方法和实践在多个轴向上存在差异,包括:活动的目的(常常模糊不清)、被评估的artifact、活动实施的环境(例如演员、资源和方法),以及它所启发的决策(例如报告、披露和缓解)。鉴于我们的发现,我们认为尽管红队测试可能是一种有价值的“大范围”概念,用于表征生成式AI伤害缓解措施,行业可能有效地在封闭环境中应用红队测试和其他策略来保护AI,但对红队测试(基于公共定义)的擅自宣称其可作为解决每一种可能风险的银弹,逼近于安全戏剧。为了向更为稳健的生成式AI评估工具箱迈进,我们将我们的建议综合为一个问题库,旨在指导和支撑未来的AI红队测试实践。
引用
@article{arxiv.2401.15897,
title = {Red-Teaming for Generative AI: Silver Bullet or Security Theater?},
author = {Michael Feffer and Anusha Sinha and Wesley Hanwen Deng and Zachary C. Lipton and Hoda Heidari},
journal= {arXiv preprint arXiv:2401.15897},
year = {2024}
}
备注
AIES 2024