中文

面向改进恶意提示注入攻击检测的预训练多语言BERT嵌入

计算与语言 2024-09-23 v1 密码学与安全

摘要

大型语言模型(LLMs)因其卓越的能力而广泛应用于各种应用,但这也带来了显著的安全漏洞。目前方法在检测和缓解大型语言模型中恶意提示注入攻击方面可能不足以应对这些漏洞在实际应用中日益复杂和不断演变的本质。因此,本工作聚焦于一种对实际LLMs应用最具危险性的漏洞——恶意提示注入攻击。我们考察了应用各种类BERT模型(双向编码器表示Transformer)来分类恶意提示和合法提示,包括多语言BERT和DistilBERT。我们观察到,对提示文本进行分词并使用多语言BERT生成嵌入,有助于提高各种机器学习方法(高斯朴素贝叶斯、随机森林、支持向量机和逻辑回归)的性能。对每个模型的性能进行严格分析,使用各种参数来改进二元分类,以发现恶意提示。多语言BERT方法嵌入提示显著提高并优于现有工作,实现了96.55%的准确率。此外,我们还检查了模型的错误预测,以获得其局限性的见解。这些发现可指导研究人员在寻找适用于不同LLMs漏洞的最佳模型时进行各种BERT的调优。

关键词

引用

@article{arxiv.2409.13331,
  title  = {Applying Pre-trained Multilingual BERT in Embeddings for Improved Malicious Prompt Injection Attacks Detection},
  author = {Md Abdur Rahman and Hossain Shahriar and Fan Wu and Alfredo Cuzzocrea},
  journal= {arXiv preprint arXiv:2409.13331},
  year   = {2024}
}