基于多层潜在原型的高效 LLM 审核
机器学习
2026-02-09 v3 人工智能
计算与语言
密码学与安全
摘要
虽然现代LLMs在后训练期间已与人类价值观一致,但在部署时仍需强大的审核功能以防止有害输出。现有方法在性能与效率之间存在权衡,且难以针对用户特定需求进行定制。针对这一空白,我们引入了多层原型审核员(Multi-Layer Prototype Moderator, MLPM),一种轻量级且高度可定制的输入审核工具。我们提出利用跨多个层次的中间表示原型来提高审核质量,同时保持高效能。就设计而言,我们的方法对生成管道的开销几乎可以忽略不计,可无缝应用于任何模型。MLPM 在多样化的审核基准测试上实现了最先进的性能,并在 various 模型家族规模范围内表现出强大的可扩展性。此外,我们展示其能够顺利集成到端到端审核管道中,并在与输出审核技术组合使用时进一步提升响应的安全性。总体而言,我们的工作为实现安全、稳健且高效的LLM部署提供了实用且可适应的解决方案。
引用
@article{arxiv.2502.16174,
title = {Efficient LLM Moderation with Multi-Layer Latent Prototypes},
author = {Maciej Chrabąszcz and Filip Szatkowski and Bartosz Wójcik and Jan Dubiński and Tomasz Trzciński and Sebastian Cygert},
journal= {arXiv preprint arXiv:2502.16174},
year = {2026}
}