中文

CAPTURE:面向上下文感知的 Prompt Injection 测试与鲁棒性提升

计算与语言 2025-06-18 v2 人工智能

摘要

Prompt injection 仍是大语言模型的主要安全风险。然而,现有围栏模型在上下文感知场景下的有效性尚未充分探讨,因为它们往往依赖静态攻击基准;此外,还存在过度防御倾向。我们提出 CAPTURE,一种新型上下文感知基准,评估攻击检测与过度防御能力,所需样本极少。实验显示,当前 prompt injection 围栏模型在对抗情形下易产生高假阴性,在良性场景中则产生过多假阳性,凸显关键局限。为展示框架实用性,我们在生成数据上训练 CaptureGuard。该新模型在上下文感知数据集上显著降低假阴性与假阳性率,并能有效泛化至外部基准,为更可靠、更实用的 prompt injection 防御指明了道路。

关键词

引用

@article{arxiv.2505.12368,
  title  = {CAPTURE: Context-Aware Prompt Injection Testing and Robustness Enhancement},
  author = {Gauri Kholkar and Ratinder Ahuja},
  journal= {arXiv preprint arXiv:2505.12368},
  year   = {2025}
}

备注

Accepted in ACL LLMSec Workshop 2025