演示:ViolentUTF——面向生成式 AI 红队的无障碍平台
密码学与安全
2025-05-01 v2
摘要
生成式 AI (GenAI) 快速融入各类应用,需要稳健的风险管理策略,其中包括红队 (RT)——一种用于模拟对抗攻击的评估方法。遗憾的是,针对 GenAI 的 RT 往往受限于技术复杂性、缺乏用户友好的界面以及不完善的报告功能。本文介绍了 Violent UTF——一个面向 GenAI 红队的无障碍、模块化且可扩展的平台。通过由 LLM 驱动且面向 LLM 的直观界面(Web GUI、CLI、API、MCP),Violent UTF 旨在赋能非技术领域专家和学生以及技术专家,通过整合 Microsoft PyRIT、Nvidia Garak 等 RT 框架及其自身专用评估器的能力,促进全面的安全评估。ViolentUTF 正被用于评估美国某大型政府部门中一款旗舰 LLM 产品的稳健性。它还在评估 LLM 在网络安全与行为心理学之间的跨领域推理能力方面展现出有效性。
引用
@article{arxiv.2504.10603,
title = {Demo: ViolentUTF as An Accessible Platform for Generative AI Red Teaming},
author = {Tam n. Nguyen},
journal= {arXiv preprint arXiv:2504.10603},
year = {2025}
}
备注
3 pages, 1 figure, 1 table. This is a demo paper for CyberWarrior2025. The video demo is at https://youtu.be/c-UCYXq0rfY. Codes will be shared when the competition concludes in June 2025 due to embargo requirements