中文

GLiGuard:基于模式条件的大语言模型安全分类

计算与语言 2026-05-11 v1 密码学与安全

摘要

确保大型语言模型输出安全、符合政策要求需要能够跨多个安全维度实现实时内容 moderation。然而,现有的先进护栏模型依赖7B至27B参数的自回归解码器,将本质上是分类问题重新表述为顺序文本生成,这种设计选择导致高延迟且难以扩展到多维度评估。本文介绍\textbf{GLiGuard},这是一种源自GLiNER2的0.3B参数模式条件双向编码器,用于大语言模型内容 moderation。核心思想是将任务定义和标签语义直接编码到输入序列中作为结构化标记模式,从而在单次非自回归前向传递中同时评估提示词安全性、响应安全性、拒绝检测、14种细粒度危害类别以及11种越狱策略。这种模式条件设计使得受支持的任务和标签块可在推理时直接组合到输入模式中。在九个已建立的安全基准测试中,GLiGuard的F1分数虽然参数规模只有7B至27B解码器模型的23至90倍,却实现了竞争水平,同时实现了最高16倍的吞吐量和17倍的延迟降低。这些结果表明,紧凑型双向编码器能够在大幅降低推理成本的同时,接近更大护栏模型的准确度。代码和模型已在https://github.com/fastino-ai/GLiGuard提供。

关键词

引用

@article{arxiv.2605.07982,
  title  = {GLiGuard: Schema-Conditioned Classification for LLM Safeguard},
  author = {Urchade Zaratiana and Mary Newhauser and George Hurn-Maloney and Ash Lewis},
  journal= {arXiv preprint arXiv:2605.07982},
  year   = {2026}
}

备注

20 pages, 4 figures