攻击掌握:面向实践者的生成式AI红队测试挑战与陷阱
密码学与安全
2024-09-25 v1 人工智能
机器学习
摘要
随着生成式人工智能,尤其是大语言模型(LLM)日益集成到生产应用程序中,新的攻击面和漏洞不断出现,聚焦于自然语言和多模态系统中的对抗性威胁。红队测试在主动识别这些系统的弱点方面日益受到重视,而蓝队测试则致力于抵御此类对抗性攻击。尽管对生成式AI的对抗风险学术兴趣不断增长,但为实践者提供的针对性指导有限,难以在实际环境中评估和缓解这些挑战。为此,我们的贡献包括:(1)对为保护生成式AI进行的红队和蓝队策略的实用检视;(2)识别在防御开发和评估中的关键挑战和开放问题;(3)攻击掌握(Attack Atlas),一种直观的框架,为实践者提供分析单轮输入攻击的方法,处于该领域的前沿。本工作旨在弥合学术洞见与实际安全措施之间的差距,以保护生成式AI系统。
引用
@article{arxiv.2409.15398,
title = {Attack Atlas: A Practitioner's Perspective on Challenges and Pitfalls in Red Teaming GenAI},
author = {Ambrish Rawat and Stefan Schoepf and Giulio Zizzo and Giandomenico Cornacchia and Muhammad Zaid Hameed and Kieran Fraser and Erik Miehling and Beat Buesser and Elizabeth M. Daly and Mark Purcell and Prasanna Sattigeri and Pin-Yu Chen and Kush R. Varshney},
journal= {arXiv preprint arXiv:2409.15398},
year = {2024}
}