Prefix Probing:用于大语言模型的轻量级有害内容检测
人工智能
2025-12-19 v1 密码学与安全
摘要
大语言模型在真实世界的安全敏感应用中面临检测准确性、推理延迟和部署成本之间的三方权衡。本文提出 Prefix Probing,一种黑箱有害内容检测方法,通过比较"同意/执行"与"拒绝/安全"开头前缀的条件对数概率,并利用前缀缓存将检测开销降低至接近首词元延迟。在推理过程中,该方法仅需对探测前缀进行一次对数概率计算即可生成有害性得分并应用阈值,无需调用任何额外模型或进行多阶段推理。为进一步增强前缀的判别能力,我们设计了一种高效的前缀构造算法,可自动发现信息量丰富的显著前缀,从而大幅提升检测性能。大量实验表明,Prefix Probing 在检测效果上与主流外部安全模型相当,同时仅产生极小的计算开销且无需额外模型部署,凸显了其强大的实用性和高效性。
引用
@article{arxiv.2512.16650,
title = {Prefix Probing: Lightweight Harmful Content Detection for Large Language Models},
author = {Jirui Yang and Hengqi Guo and Zhihui Lu and Yi Zhao and Yuansen Zhang and Shijing Hu and Qiang Duan and Yinggui Wang and Tao Wei},
journal= {arXiv preprint arXiv:2512.16650},
year = {2025}
}