MoJE:越狱专家混合,将朴素表格分类器用作提示攻击的防护
密码学与安全
2024-10-07 v3 人工智能
机器学习
摘要
大型语言模型(LLMs)在多种应用中的普及,凸显了采取稳健安全措施以阻止潜在越狱攻击的迫切需求。这些攻击利用 LLMs 内部的漏洞,危及数据完整性和用户隐私。防护栏是抵御此类威胁的关键保护机制,但现有模型在检测准确性和计算效率方面往往存在不足。本文主张了预防 LLMs 越狱攻击的重要性,并强调了输入防护栏在保护这些模型中的作用。我们引入了 MoJE(越狱专家混合),这是一种新颖的防护栏架构,旨在超越当前最先进防护栏的局限性。通过采用简单的语言统计技术,MoJE 在检测越狱攻击方面表现出色,同时在模型推理期间保持最小的计算开销。通过严格的实验,MoJE 展示了卓越的性能,能够在不损害良性提示的情况下检测出 90% 的攻击,增强了 LLM 抵御越狱攻击的安全性。
引用
@article{arxiv.2409.17699,
title = {MoJE: Mixture of Jailbreak Experts, Naive Tabular Classifiers as Guard for Prompt Attacks},
author = {Giandomenico Cornacchia and Giulio Zizzo and Kieran Fraser and Muhammad Zaid Hameed and Ambrish Rawat and Mark Purcell},
journal= {arXiv preprint arXiv:2409.17699},
year = {2024}
}