中文

OpenGuardrails:面向大语言模型的可配置、统一且可扩展的警戒平台

密码学与安全 2025-10-30 v2 计算与语言

摘要

随着大语言模型(LLM)越来越多地集成到实际应用中,确保其安全性、鲁健性和隐私合规性已成为关键。我们提出 OpenGuardrails,这是第一个完全开源的平台,统一了基于大模型的安全检测、操纵防御以及可部署的警戒基础设施。OpenGuardrails 针对三类主要风险提供保护:(1)内容安全违规,如有害或色情文本生成;(2)模型操纵攻击,包括提示注入、越狱和代码解释器滥用;(3)数据泄露,涉及敏感或私人信息。不同于先前的模块化或基于规则的框架,OpenGuardrails 引入了三个核心创新:(1)可配置的策略适应机制,允许对不安全类别和灵敏度阈值进行逐请求定制;(2)统一的基于 LLM 的警戒架构,在单个模型中执行内容安全和操纵检测;(3)量化的可扩展模型设计,将 14B 稠密基模型压缩至 3.3B,保持超过 98% 的基准准确率。该系统支持 119 种语言,在多语言安全基准中实现最先进性能,可作为企业用的安全网关或 API 服务进行部署。所有模型、数据集和部署脚本均在 Apache 2.0 许可下发布。

关键词

引用

@article{arxiv.2510.19169,
  title  = {OpenGuardrails: A Configurable, Unified, and Scalable Guardrails Platform for Large Language Models},
  author = {Thomas Wang and Haowen Li},
  journal= {arXiv preprint arXiv:2510.19169},
  year   = {2025}
}