Opir:面向毒性、越狱、仇恨言论和有害内容的高效多任务安全分类
机器学习
2026-05-29 v1 人工智能
计算与语言
摘要
大语言模型 (Large Language Model, LLM) 应用的实时安全过滤需要能够检测不安全的提示、有毒语言、越狱尝试以及不安全响应的分类器,而且不必具有大型护栏模型的成本配置,还能区分良性敏感文本与真正的隐蔽有害内容。在本文中,我们介绍了 Opir,一个基于 GLiClass 架构构建的 encoder-based 护栏模型系列。Opir 包括用于二元 safe/unsafe 分类的多任务模型、用于多标签毒性分类的模型、用于越狱分类的模型,以及用于零样本不安全提示和响应分类的模型。我们也发布了参数不足 100 万的 edge 变体,专用于二元 safe/unsafe 分类。Opir 的训练数据结合了基于分类学的不安全提示、对抗挖掘的硬负样本、保持安全的良性示例、生成的响应示例、多语言翻译,以及 Aegis2 和 WildGuard 训练子集的部分数据。我们也开源了一个评估工具包,支持 GLiClass 和 GLiNER2 后端以及 decoder-based 模型,覆盖二元安全分类、多标签分类、毒性、越狱检测、提示安全、响应安全、响应拒绝以及提示子类别视图,涵盖公开基准家族。在扩大的比较中,涵盖 12 个安全分类任务和 17 个类别任务,对比八个当代护栏系统——包括基于 GLiNER2 的和生成式护栏模型——Opir 变体在多数基准数据集上与最强的 open-weight 基线相当或领先,同时具有显著更小的部署占用面积。
引用
@article{arxiv.2605.29659,
title = {Opir: Efficient Multi-Task Safety Classification for Toxicity, Jailbreaks, Hate Speech, and Harmful Content},
author = {Ihor Stepanov and Aleksandr Smechov},
journal= {arXiv preprint arXiv:2605.29659},
year = {2026}
}
备注
23 pages, 4 figures, 9 tables