InjecGuard:提示注入护栏模型中的过度防御基准测试与缓解
计算与语言
2025-04-01 v3 人工智能
密码学与安全
摘要
提示注入攻击对大型语言模型(LLM)构成严重威胁,可能导致目标劫持和数据泄露。提示护栏模型虽然在防御上有效,但存在过度防御问题——由于触发词偏差,会将良性输入错误标记为恶意。为解决此问题,我们引入了NotInject,这是一个评估数据集,用于系统性地衡量各种提示护栏模型的过度防御情况。NotInject包含339个富含提示注入攻击中常见触发词的良性样本,支持细粒度评估。我们的结果表明,最先进的模型存在过度防御问题,准确率下降至接近随机猜测的水平(60%)。为了缓解这一问题,我们提出了InjecGuard,一种新颖的提示护栏模型,它采用了一种新的训练策略——免费缓解过度防御(MOF),显著降低了对触发词的偏差。InjecGuard在包括NotInject在内的多种基准测试中展示了最先进的性能,比现有最佳模型高出30.8%,为检测提示注入攻击提供了一个稳健且开源的解决方案。代码和数据集已在https://github.com/leolee99/InjecGuard发布。
引用
@article{arxiv.2410.22770,
title = {InjecGuard: Benchmarking and Mitigating Over-defense in Prompt Injection Guardrail Models},
author = {Hao Li and Xiaogeng Liu},
journal= {arXiv preprint arXiv:2410.22770},
year = {2025}
}