基于预训练模型和启发式特征工程的提示注入检测方法
计算与语言
2025-06-10 v1 人工智能
摘要
随着大型语言模型(LLM)的广泛采用,提示注入攻击已成为重要的安全威胁。现有防御机制常面临有效性和通用性之间的严重权衡。这凸显了迫切需要适用于广泛 LLM 的高效提示注入检测方法。为此,我们提出了一种基于双通道特征融合的检测框架——DMPI-PMHFE。该框架将预训练语言模型与启发式特征工程相结合,用于检测提示注入攻击。具体而言,该框架采用 DeBERTa-v3-base 作为特征提取器,将输入文本转换为带有上下文信息丰富化的语义向量。同时,我们基于已知攻击模式设计的启发式规则,用于提取常见于攻击的显式结构特征。两通道特征随后被融合并通过全连接神经网络进行最终预测。这种双通道方法缓解了仅依赖 DeBERTa 提取特征的局限性。实验结果表明,DMPI-PMHFE 在 diverse benchmark 数据集上在准确率、召回率和 F1 分数方面均优于现有方法。此外,实际部署后,该方法在包括 GLM-4、LLaMA 3、Qwen 2.5 和 GPT-4o 在内的主流 LLM 上显著降低了攻击成功率。
引用
@article{arxiv.2506.06384,
title = {Detection Method for Prompt Injection by Integrating Pre-trained Model and Heuristic Feature Engineering},
author = {Yi Ji and Runzhi Li and Baolei Mao},
journal= {arXiv preprint arXiv:2506.06384},
year = {2025}
}
备注
Accepted by KSEM2025 AI & Sec Workshop