PyRIT:面向生成式 AI 系统的安全风险识别与红队作战框架
密码学与安全
2024-10-07 v1 人工智能
计算与语言
摘要
生成式人工智能(GenAI)正在渗透到我们的日常生活中。计算能力的提升和数据资源的丰富,导致单模态和多模态模型的数量大幅增加。随着 GenAI 生态系统的成熟,对可扩展且与模型无关的风险识别框架需求日益增长。为满足这一需求,我们介绍 Python Risk Identification Toolkit(PyRIT),这是一款开源框架,旨在增强 GenAI 系统的红队作战工作。PyRIT 是一个面向模型和平台的通用工具,使红队人员能够探测和识别多模态生成式 AI 模型中的新颖伤害、风险和越狱行为。其可组合架构促进了核心构建模块的重用,并允许针对未来模型和模态进行扩展。本文详细阐述了针对生成式 AI 系统进行红队作战的挑战、PyRIT 的开发与功能,以及其在实际场景中的实际应用。
引用
@article{arxiv.2410.02828,
title = {PyRIT: A Framework for Security Risk Identification and Red Teaming in Generative AI System},
author = {Gary D. Lopez Munoz and Amanda J. Minnich and Roman Lutz and Richard Lundeen and Raja Sekhar Rao Dheekonda and Nina Chikanov and Bolor-Erdene Jagdagdorj and Martin Pouliot and Shiven Chawla and Whitney Maxwell and Blake Bullwinkel and Katherine Pratt and Joris de Gruyter and Charlotte Siska and Pete Bryan and Tori Westerhoff and Chang Kawaguchi and Christian Seifert and Ram Shankar Siva Kumar and Yonatan Zunger},
journal= {arXiv preprint arXiv:2410.02828},
year = {2024}
}