中文

面向可靠大语言模型的下一代守护者模型:Guardian-as-an-Advisor

机器学习 2026-04-10 v1 计算与语言

摘要

硬门控安全检查器常常过度拒绝并与供应商模型规格不一致;现行分类体系也忽略了鲁棒性和诚实性,导致 safer-on-paper 但实际上不够有用的系统。本工作引入 Guardian-as-an-Advisor (GaaA),一种软门控管道,其中守护者预测二元风险标签并附加简洁解释,将此建议拼接到原始查询中用于重新推理,使基础模型在原有规格下运行。为支持训练和评估,我们构建了 GuardSet,一个 208k+ 多领域数据集,统一了有害与无害案例并包含针对鲁棒性和诚实性的特定切片。GuardAdvisor 通过 SFT 再通过 RL 训练,以实现标签-解释一致性。GuardAdvisor 在检测准确率上达到竞争水平,同时实现了建议工作流程;当用于增强输入时,响应优于未增强的提示。延迟研究显示,建议推理仅使用基础模型计算的 5%,在现实的有害输入率下仅增加 2-10% 的端到端开销。总体而言,GaaA 使模型遵循模型规格,在保持安全性的同时减少了过度拒绝。

关键词

引用

@article{arxiv.2604.07655,
  title  = {Guardian-as-an-Advisor: Advancing Next-Generation Guardian Models for Trustworthy LLMs},
  author = {Yue Huang and Haomin Zhuang and Jiayi Ye and Han Bao and Yanbo Wang and Hang Hua and Siyuan Wu and Pin-Yu Chen and Xiangliang Zhang},
  journal= {arXiv preprint arXiv:2604.07655},
  year   = {2026}
}