面向 LLM 流式输出的值基安全预测
摘要
在许多实际 LLM 部署中,单一的 guardrail 用于 prompt 和 response 的双重监管。Prompt 监管基于完全观察到的文本工作,而流式 response 监管需要对部分生成文本做出安全决策。现有的基于文本的流式 guardrail 常将输出侧问题建模为边界检测,训练模型识别 response 已变为不安全的最早前缀。在本工作中,我们引入 StreamGuard,一种统一且模型无关的流式 guardrail,其将监管建模为预测问题:给定部分前缀,模型预测可能的未来续写的预期有害程度。我们通过蒙特卡洛抽样 (Monte Carlo) rollout 来监督此预测,从而实现在无需精确 token 级边界标注的情况下进行早期干预。在标准安全基准测试中,StreamGuard 在输入监管和流式输出监管方面均表现强劲。规模为 8B 时,StreamGuard 将聚合输入监管 F1 从 86.7 提升至 88.2,将聚合流式输出监管 F1 从 80.4 提升至 81.9。在 QWENGUARDTEST response_loc 流式基准测试中,StreamGuard 达到 97.5 F1、95.1 recall 和 92.6% 的准时干预率,较 Qwen3Guard-Stream-8B-strict 的 95.9 F1、92.1 recall 和 89.9% 实现了显著提升,漏检率从 7.9% 降至 4.9%。我们进一步表明,基于预测的监督可在不同 tokenizer 和模型家族之间有效迁移:使用迁移目标,Gemma3-StreamGuard-1B 达到 81.3 response 监管 F1、98.2 流式 F1 和 3.5% 漏检率。这些结果表明,在无需精确边界标签的情况下即可获得强大的端到端流式监管,预测未来风险是为低延迟安全干预的有效监督策略。
引用
@article{arxiv.2604.03962,
title = {Predict, Don't React: Value-Based Safety Forecasting for LLM Streaming},
author = {Pride Kavumba and Koki Wataoka and Huy H. Nguyen and Jiaxuan Li and Masaya Ohagi},
journal= {arXiv preprint arXiv:2604.03962},
year = {2026}
}