守卫向量:基于任务向量组合与流式感知前缀 SFT 的超越英语 LLM 警戒
计算与语言
2025-09-30 v1
摘要
我们提出 Guard Vector,即计算一个守卫模型 (Guard Model) 与相同架构的预训练语言模型之间的参数差异所得到的安全任务向量。将该向量与目标语言模型组合即可得到目标守卫模型 (TGM)。随后,我们采用结合前缀训练与评估的流式感知方法,辅以产生单 token 输出的分类器。仅凭该组合,TGM 在标准安全套件上超越既定守卫模型的分类质量,并实现对中文、日文、韩文的语言可扩展性,无需额外训练或目标语言标签。它还显示出对两种广泛使用的公共守卫模型后端(Llama 和 Gemma)的模型可移植性。通过前缀 SFT (监督微调),TGM 在前缀输入与完整文本输入之间的行为对齐,从而保持流式下的分类质量。单 token 输出设计提升了吞吐量并降低了延迟。综上,这些组件减少了数据和计算需求,推动了更负责任的 AI 生态系统发展。
关键词
引用
@article{arxiv.2509.23381,
title = {Guard Vector: Beyond English LLM Guardrails with Task-Vector Composition and Streaming-Aware Prefix SFT},
author = {Wonhyuk Lee and Youngchol Kim and Yunjin Park and Junhyung Moon and Dongyoung Jeong and Wanjin Park},
journal= {arXiv preprint arXiv:2509.23381},
year = {2025}
}