从 100 个生成式 AI 产品的红队测试中汲取的经验教训
人工智能
2025-01-14 v1
摘要
近年来,AI 红队测试已成为探索生成式 AI 系统安全性和可靠性的实践方式。鉴于该领域尚处于萌芽阶段,关于如何开展红队测试操作仍存在诸多未决问题。基于我们在微软对超过 100 个生成式 AI 产品进行红队测试的经验,本文提出我们的内部威胁模型本体法学派及八项主要经验教训:1. 理解系统能做什么以及其应用场景 2. 无需计算梯度即可破解 AI 系统 3. AI 红队测试并非安全基准测试 4. 自动化有助于覆盖更广的风险图谱 5. AI 红队测试的人因至关重要 6. 负责任的 AI 伤害普遍存在但难以衡量 7. 大语言模型(LLM)放大了现有的安全风险并引入了新的风险 8. 保障 AI 系统的工作永远无法完成。通过分享这些见识及我们操作中的案例研究,旨在为与实际风险相一致的红队测试工作提供实用建议。我们还指出了一些常被误解的 AI 红队测试方面,并讨论了该领域应考虑的开放性问题。
引用
@article{arxiv.2501.07238,
title = {Lessons From Red Teaming 100 Generative AI Products},
author = {Blake Bullwinkel and Amanda Minnich and Shiven Chawla and Gary Lopez and Martin Pouliot and Whitney Maxwell and Joris de Gruyter and Katherine Pratt and Saphir Qi and Nina Chikanov and Roman Lutz and Raja Sekhar Rao Dheekonda and Bolor-Erdene Jagdagdorj and Eugenia Kim and Justin Song and Keegan Hines and Daniel Jones and Giorgio Severi and Richard Lundeen and Sam Vaughan and Victoria Westerhoff and Pete Bryan and Ram Shankar Siva Kumar and Yonatan Zunger and Chang Kawaguchi and Mark Russinovich},
journal= {arXiv preprint arXiv:2501.07238},
year = {2025}
}