中文

从判断到干预:通过流式内容监控实现 LLM 有害输出的提前停止

计算与语言 2025-09-23 v3 计算机与社会

摘要

尽管安全对齐已应用于大多数大语言模型(LLM),但 LLM 服务提供商通常会在实际产品中部署后续审核作为外部安全护栏。现有审核器主要采用传统的完整检测方法,基于完整的 LLM 输出判断有害性,从而导致较高的服务延迟。近期研究更多关注部分检测,即审核器在生成过程中途进行监控并在检测到有害性时提前停止输出,但他们直接将采用完整检测范式训练的审核器应用于不完整的输出,从而引入了训练-推理差距,降低了性能。在本文中,我们探索如何构建一种原生支持部分检测的数据与模型解决方案。在数据方面,我们构建了 FineHarm,一个包含 29K 个提示-响应对的数据集,并带有细粒度标注,为 token 级别的训练提供合理的监督信号。然后,我们提出流式内容监控器(Streaming Content Monitor),它通过响应级别和 token 级别的双重监督进行训练,能够跟随 LLM 的输出流及时判断有害性。实验表明,SCM 仅需平均查看响应中前 18% 的 token,即可获得 0.95+ 的 macro F1 分数,与完整检测相当。此外,SCM 可以作为伪有害性标注器来改进安全对齐,并获得比 DPO 更高的无害性得分。

关键词

引用

@article{arxiv.2506.09996,
  title  = {From Judgment to Interference: Early Stopping LLM Harmful Outputs via Streaming Content Monitoring},
  author = {Yang Li and Qiang Sheng and Yehan Yang and Xueyao Zhang and Juan Cao},
  journal= {arXiv preprint arXiv:2506.09996},
  year   = {2025}
}

备注

NeurIPS 2025 Accepted Paper