中文

Sentinel:面向抵御提示注入攻击的 SOTA 检测模型

密码学与安全 2025-06-09 v1 人工智能

摘要

大型语言模型(LLM)日益强大,但仍然容易受到提示注入攻击的威胁——恶意输入会导致模型偏离其既定指令。本文介绍了 Sentinel,一种新型检测模型,基于 \answerdotai/ModernBERT-large 架构。通过利用 ModernBERT 的先进特性,并在广泛且多样化的数据集上微调(包括少量开源和私有数据集合),Sentinel 实现了最先进的性能。该数据集融合了多种攻击类型,从角色扮演和指令劫持到生成偏见内容的尝试,以及广泛的良性指令,其中私有数据集特别针对细致的错误纠正和实际误分类进行了设计。在综合的、未见的内部测试集上,Sentinel 显示出平均准确率为 0.987,F1 分数为 0.980。此外,在公共基准测试中,它持续优于诸如 protectai/deberta-v3-base-prompt-injection-v2 等强大基线。本文详细阐述了 Sentinel 的架构、其严谨的数据集精选、训练方法以及全面评估,凸显了其卓越的检测能力。

关键词

引用

@article{arxiv.2506.05446,
  title  = {Sentinel: SOTA model to protect against prompt injections},
  author = {Dror Ivry and Oran Nahum},
  journal= {arXiv preprint arXiv:2506.05446},
  year   = {2025}
}

备注

6 pages, 2 tables