提示注入作为新兴威胁:评估大语言模型的抗性
密码学与安全
2025-11-13 v2 人工智能
摘要
大语言模型 (LLM) 越来越多地被用于执行推理、摘要和代码生成的智能系统中。其遵循自然语言指令的能力虽强大,但也使其易受一种新型攻击——提示注入(prompt injection)的威胁。在这些攻击中,隐藏或恶意指令被插入用户输入或外部内容,导致模型忽略其原本的任务或产生不安全的响应。本研究提出了一个统一的框架,用于评估大语言模型 (LLM) 对提示注入攻击的抗性。该框架定义了三种互补的指标:韧性降解指数 (Resilience Degradation Index, RDI)、安全合规系数 (Safety Compliance Coefficient, SCC) 和指令完整性指标 (Instructional Integrity Metric, IIM),用于共同衡量韧性、安全性和语义稳定性。我们在五个常见语言任务上评估了四个指令调优模型(GPT-4、GPT-4o、LLaMA-3 8B Instruct 和 Flan-T5-Large),包括问答、摘要、翻译、推理和代码生成。结果表明,GPT-4 在总体上表现最佳,而开源模型则更易受攻击。研究发现,强大的对齐和安全调优比模型规模本身在韧性方面更为重要。所有模型仍具部分脆弱性,尤其是针对间接攻击和直接覆盖攻击。GPT-4 实现了最佳的整体韧性(RDR = 9.8%,SCR = 96.4%),而开源模型表现出更高的性能退化和较低的安全得分。本研究的发现表明,对齐强度和安全调优在韧性方面的作用大于模型规模。该提出的框架提供了一个结构化、可复现的方法,用于评估模型韧性,并为改进大语言模型的安全性和可靠性提供了实用见解。
引用
@article{arxiv.2511.01634,
title = {Prompt Injection as an Emerging Threat: Evaluating the Resilience of Large Language Models},
author = {Daniyal Ganiuly and Assel Smaiyl},
journal= {arXiv preprint arXiv:2511.01634},
year = {2025}
}
备注
10 pages, 6 figures