中文

CourtGuard:一种本地化、多智能体提示注入分类器

密码学与安全 2025-10-24 v1 人工智能

摘要

随着大语言模型(LLMs)被集成到各类敏感应用中,提示注入——即利用提示诱导LLMs产生有害行为——所面临的风险日益增加。提示注入攻击可能导致LLMs泄露敏感数据、传播虚假信息或表现出有害行为。为了对抗这些攻击,我们提出CourtGuard——一个可本地运行的、基于多智能体的提示注入分类器。在其中,提示在类似法庭的多智能体LLM系统中进行评估,其中“防御律师”模型论证提示是良性的,“检方律师”模型论证提示是提示注入,“法官”模型给出最终分类。CourtGuard的假阳性率低于以LLM作为法官的Direct Detector。然而,CourtGuard通常是较差的提示注入检测器。尽管如此,这一较低的假阳性率凸显了在提示分类中考虑对抗和良性情形的重要性。此外,CourtGuard与其他提示注入分类器之间的相对性能推动了将多智能体系统作为抵御提示注入攻击的手段。CourtGuard和Direct Detector的实现(包含Gemma-3-12b-it、Llama-3.3-8B和Phi-4-mini-instruct的完整提示)已在https://github.com/isaacwu2000/CourtGuard 上提供。

关键词

引用

@article{arxiv.2510.19844,
  title  = {CourtGuard: A Local, Multiagent Prompt Injection Classifier},
  author = {Isaac Wu and Michael Maslowski},
  journal= {arXiv preprint arXiv:2510.19844},
  year   = {2025}
}

备注

11 pages, 7 figures