大型语言模型中高效有毒提示检测
密码学与安全
2025-09-03 v3 人工智能
计算与语言
软件工程
摘要
大型语言模型(Large Language Model,LLM)如 ChatGPT 和 Gemini 已显著推动自然语言处理领域的发展,使其能够应用于聊天机器人和自动内容生成等各种应用。然而,这些模型可能被恶意人员利用,通过设计有毒提示(toxic prompts)来诱发有害或不道德的响应。这些人员常采用越狱(jailbreaking)技术绕过安全机制,这凸显了对鲁健有毒提示检测方法的需求。现有检测技术,无论是黑盒或白盒,都面临着有毒提示多样性、可扩展性和计算效率等挑战。为此,我们提出了 ToxicDetector,一种轻量级灰盒方法,旨在高效检测 LLM 中的有毒提示。ToxicDetector 利用 LLM 生成有毒概念提示,使用嵌入向量构建特征向量,并采用多层感知机(Multi-Layer Perceptron,MLP)分类器进行提示分类。我们在 various 版本的 LLaMA 模型、Gemma-2 以及多个数据集上进行评估,结果显示 ToxicDetector 在检测有毒提示方面 achieves 高达 96.39% 的准确率和仅 2.00% 的误报率,显著优于当前最先进的方法。此外,ToxicDetector 每个提示仅需 0.0780 秒的处理时间,使其高度适用于实时应用。ToxicDetector 在准确性、效率和可扩展性方面均表现出色,成为 LLM 中有毒提示检测的实用方法。
引用
@article{arxiv.2408.11727,
title = {Efficient Detection of Toxic Prompts in Large Language Models},
author = {Yi Liu and Junzhe Yu and Huijia Sun and Ling Shi and Gelei Deng and Yuqi Chen and Yang Liu},
journal= {arXiv preprint arXiv:2408.11727},
year = {2025}
}
备注
Accepted by the 39th IEEE/ACM International Conference on Automated Software Engineering (ASE 2024)