中文

CAPTURE:面向上下文感知的提示注入测试与鲁棒性增强

代数几何 2025-05-29 v2

摘要

提示注入仍是大语言模型的主要安全风险。然而,现有围栏模型在上下文感知场景下的有效性尚未得到充分探讨,因为它们往往依赖静态攻击基准。此外,这些模型存在过度防御的倾向。我们引入 CAPTURE,一个新型上下文感知基准,用于评估攻击检测和过度防御能力,同时仅需少量领域内样本。我们的实验表明,当前的提示注入围栏模型在对抗情况下的假阴性率较高,同时在良好场景下的假阳性率过高,凸显了其关键局限性。为展示框架的实用性,我们在生成数据上训练了 CaptureGuard。该新模型在上下文感知数据集上显著降低了假阴性和假阳性率,并在外部基准上表现出良好的泛化能力,为实现更可靠、更实用的提示注入防御指出了道路。

关键词

引用

@article{arxiv.2505.12367,
  title  = {On a formula for the equivariant Euler characteristic of a $G$-sheaf},
  author = {Qiangru Kuang and Francesco Sala},
  journal= {arXiv preprint arXiv:2505.12367},
  year   = {2025}
}