中文

Kelp:通过潜在动态引导的风险检测实现大型模型的流式安全防护

机器学习 2025-10-14 v1 人工智能

摘要

大型模型是强大的内容生成器,但其开放式特性也可能引入潜在风险,例如生成有害或有偏见的内容。现有的防护措施大多执行事后检测,可能在捕获不安全内容之前就已暴露,而延迟约束进一步促使它们采用轻量级模型,限制了检测准确性。在这项工作中,我们提出了Kelp,一种新颖的插件框架,可在大型模型生成流程中实现流式风险检测。Kelp通过流式潜在动态头利用中间大型模型隐藏状态,该动态头对生成序列中风险的时间演化进行建模,以实现更准确的实时风险检测。为确保实际应用中可靠的流式审核,我们引入了一种锚定时间一致性损失,通过嵌入良性-然后-有害的时间先验来强制单调的危害预测。此外,为了严格评估流式防护措施,我们还提出了StreamGuardBench——一个基于模型的基准测试,具有来自每个受保护模型的即时响应,反映了文本和视觉-语言任务中的真实流式场景。在多种模型和数据集上,Kelp始终优于最先进的事后防护措施和先前的插件探针(平均F1高出15.61%),同时仅使用2000万个参数,每个令牌延迟增加不到0.5毫秒。

关键词

引用

@article{arxiv.2510.09694,
  title  = {Kelp: A Streaming Safeguard for Large Models via Latent Dynamics-Guided Risk Detection},
  author = {Xiaodan Li and Mengjie Wu and Yao Zhu and Yunna Lv and YueFeng Chen and Cen Chen and Jianmei Guo and Hui Xue},
  journal= {arXiv preprint arXiv:2510.09694},
  year   = {2025}
}