基于 LLM 判官与混合模型的 Prompt 攻击检测
计算与语言
2026-03-27 v1
摘要
Prompt 攻击,包括越狱和提示注入,构成了大型语言模型(LLM)系统的关键安全风险。在实际部署中,警戒措施必须在严格的低延迟约束下进行防御,这导致了一种部署鸿沟,其中轻量级分类器和基于规则的系统在分布迁移下难以泛化,而高容量 LLM 判官虽然仍然过于缓慢或昂贵,无法用于实时强制执行。本文我们检验了轻量级、通用 LLM 是否能在实际生产约束下充当安全判官。通过谨慎的提示和输出设计,轻量级 LLM 通过明确意图分解、安全信号验证、危害评估和自我反思等结构化推理过程得到引导。我们在构建的评估数据集上进行测试,该数据集将来自真实聊天机器人的善意查询与通过自动红队(ART)生成的对抗提示相结合,涵盖多样且不断演化的模式。我们的结果表明,通用 LLM 如 gemini-2.0-flash-lite-001 可作为实时警戒的低延迟判官。该配置已在新加坡公共服务聊天机器人的中心化警戒服务中部署。我们还评估了混合模型(MoM)设置,以评估聚合多个 LLM 判官是否相对于单模型判官提高了 Prompt 攻击检测性能,仅见 modest 的提升。
引用
@article{arxiv.2603.25176,
title = {Prompt Attack Detection with LLM-as-a-Judge and Mixture-of-Models},
author = {Hieu Xuan Le and Benjamin Goh and Quy Anh Tang},
journal= {arXiv preprint arXiv:2603.25176},
year = {2026}
}
备注
16 pages, 3 figures