中文

验证意图与危害:针对LLM生成威胁的统一防御

密码学与安全 2026-06-24 v1

摘要

大型语言模型(LLM)越来越多地部署在交互式应用中,但它们仍然容易受到诱导产生有害、欺骗性或违反政策输出的对抗性交互的影响。现有的防御措施通常要么分析用户提示,要么分析生成的输出,但不会同时分析两者。然而,许多现实世界的攻击利用了提示中表达的对抗性意图与仅在响应中体现的可操作危害之间的分离。因此,仅提示和仅响应的防御措施常常会漏掉那些从任何单一方面看都显得良性的不安全交互。我们提出了一种以验证为中心的防御框架,在LLM响应传递给用户之前,联合评估提示意图和响应危害。该框架采用专门的意图和危害评估分析器,以及一个用于冲突解决的裁判。我们形式化了提示-响应攻击的威胁模型,并在五类威胁中评估了该框架:越狱、提示注入、网络钓鱼、网络滥用和有害内容。在多个基准数据集上的实验表明,联合验证提示意图和响应危害始终优于单侧防御和单代理推理基线。在各种威胁类别中,该框架将平均F1分数从最强适用基线的0.90提高到0.95,同时将平均攻击成功率降低到4.1%。与单代理+CoT基线相比,它将平均F1分数从0.87提高到0.95,并将良性敏感请求的误报率从0.12降低到0.06。我们进一步评估了架构感知的自适应攻击,其中攻击者知道验证器结构并试图绕过单个验证组件。我们的结果表明,提示-响应验证为保护LLM应用免受不断演变的对抗性威胁提供了实用基础。

关键词

引用

@article{arxiv.2606.26377,
  title  = {Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats},
  author = {Poojitha Thota and Yun Lei and Santhosh Thangaraj and Siddhartha Reddy Jonnalagadda and Shirin Nilizadeh},
  journal= {arXiv preprint arXiv:2606.26377},
  year   = {2026}
}