护栏没有免费餐
密码学与安全
2025-04-04 v2 人工智能
摘要
随着大型语言模型(LLM)和生成式AI的广泛应用,护栏已成为确保其安全使用的关键工具。然而,添加护栏并非没有代价;更强的安全措施会降低可用性,而更灵活的系统则可能留下对抗性攻击的漏洞。本文探讨当前护栏是否有效防止滥用,同时维持实际效用。我们引入一个评估框架,衡量不同护栏如何在风险、安全性和可用性之间进行权衡,并构建了一个高效护栏。我们的发现确认护栏没有免费餐;加强安全性往往以牺牲可用性为代价。为此,我们提出了设计更佳护栏的蓝图,以最小化风险同时保持可用性。我们评估了包括Azure Content Safety、Bedrock Guardrails、OpenAI的Moderation API、Guardrails AI、Nemo Guardrails和Enkrypt AI等各类行业护栏。此外,我们考察了GPT-4o、Gemini 2.0-Flash、Claude 3.5-Sonnet和Mistral Large-Latest等LLM在不同系统提示下的响应情况,包括简单提示、详细提示以及带有链式思考(CoT)推理的详细提示。我们的研究提供了不同护栏表现的清晰比较,凸显了在安全性和可用性之间进行权衡的挑战。
引用
@article{arxiv.2504.00441,
title = {No Free Lunch with Guardrails},
author = {Divyanshu Kumar and Nitin Aravind Birur and Tanay Baswa and Sahil Agarwal and Prashanth Harshangi},
journal= {arXiv preprint arXiv:2504.00441},
year = {2025}
}