SoK: 大型语言模型中提示安全的分类与评估
密码学与安全
2025-10-22 v2 人工智能
摘要
大型语言模型(LLM)已迅速成为实际应用中不可或缺的一部分,为不同领域的服务提供支持。然而,它们的广泛部署暴露了关键的安全风险,特别是通过越狱提示,这些提示可以绕过模型对齐并诱导产生有害输出。尽管对攻击和防御技术进行了深入研究,但该领域仍然支离破碎:定义、威胁模型和评估标准差异很大,阻碍了系统性进展和公平比较。在这项系统化知识(SoK)工作中,我们通过以下方式应对这些挑战:(1) 提出一个整体的、多层次的分类法,用于组织LLM提示安全中的攻击、防御和漏洞;(2) 将威胁模型和成本假设形式化为机器可读的配置文件,以实现可重复的评估;(3) 引入一个开源评估工具包,用于对攻击和防御进行标准化、可审计的比较;(4) 发布JAILBREAKDB,这是迄今为止最大的带注释的越狱和良性提示数据集;\footnote{该数据集发布于 \href{https://huggingface.co/datasets/youbin2014/JailbreakDB}{\textcolor{purple}{https://huggingface.co/datasets/youbin2014/JailbreakDB}}。} 以及 (5) 提供一个全面的评估平台和最新方法的排行榜\footnote{即将发布。}。我们的工作统一了碎片化的研究,为未来的研究提供了严谨的基础,并支持开发适用于高风险部署的稳健、可信的LLM。
引用
@article{arxiv.2510.15476,
title = {SoK: Taxonomy and Evaluation of Prompt Security in Large Language Models},
author = {Hanbin Hong and Shuya Feng and Nima Naderloui and Shenao Yan and Jingyu Zhang and Biying Liu and Ali Arastehfard and Heqing Huang and Yuan Hong},
journal= {arXiv preprint arXiv:2510.15476},
year = {2025}
}