构建安全的生成式AI应用:大型语言模型红队测试的端到端概述
计算与语言
2025-03-06 v2
摘要
大型语言模型(LLM)的快速发展带来了显著的隐私、安全和伦理问题。虽然已有大量研究提出了针对恶意行为者滥用LLM系统的防御方法,但近期研究者们通过红队测试(即主动攻击LLM以识别其漏洞)补充了这些防御性努力。本文提供了关于LLM红队测试文献的简洁实用概述,结构化呈现多组件系统的端到端流程。为激发红队测试动机,我们调查了一些知名LLM的初始安全需求,然后深入探讨红队测试系统的各个组成部分及实现这些组件的软件包。我们涵盖了各种攻击方法、攻击成功评估策略、实验结果评估指标,以及众多其他考虑因素。我们的调查对任何希望快速掌握红队测试核心概念以用于实际应用的读者都有帮助。
引用
@article{arxiv.2503.01742,
title = {Building Safe GenAI Applications: An End-to-End Overview of Red Teaming for Large Language Models},
author = {Alberto Purpura and Sahil Wadhwa and Jesse Zymet and Akshay Gupta and Andy Luo and Melissa Kazemi Rad and Swapnil Shinde and Mohammad Shahed Sorower},
journal= {arXiv preprint arXiv:2503.01742},
year = {2025}
}