中文

NExT-Guard:无需token级标签的训练-free流式安全护卫

机器学习 2026-03-04 v1 人工智能

摘要

大语言模型在流式场景中的部署日益增多,但基于后处理安全措施在实时干拦 unsafe 内容方面无效。虽然基于token级监督训练的流式安全措施可以解决此问题,但需要昂贵的标注且严重过拟合。本文挑战了流式安全必须依赖token级监督训练的范式。相反,经过充分训练的后处理安全措施已经在隐藏表示中编码了token级风险信号。因此,我们引入 NExT-Guard,一个无需训练的框架,通过监控稀疏自编码器(SAE)中的可解释潜在特征实现流式安全。它使用来自公开基础LLM的预训练SAE,实现灵活、低成本的部署,无需token级监督。实验结果表明,NExT-Guard 在鲁棒性上优于基于后处理和基于监督训练的流式安全措施,在模型、SAE变体和风险场景方面表现出优异鲁棒性。这些结果使 NExT-Guard 成为实时安全的通用可扩展范式,加速了流式安全护卫的实际部署。

关键词

引用

@article{arxiv.2603.02219,
  title  = {NExT-Guard: Training-Free Streaming Safeguard without Token-Level Labels},
  author = {Junfeng Fang and Nachuan Chen and Houcheng Jiang and Dan Zhang and Fei Shen and Xiang Wang and Xiangnan He and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2603.02219},
  year   = {2026}
}