中文

通过 AI 多智能体 NLP 框架检测与缓解提示注入

人工智能 2025-03-17 v1 计算与语言 多智能体系统

摘要

提示注入通过诱导生成非预期输出,对生成式 AI 系统构成了重大挑战。我们引入了一个多智能体 NLP 框架,该框架专门设计用于通过分层检测与执行机制来应对提示注入漏洞。该框架协调多个专用智能体以生成响应、净化输出并执行策略合规性。在 500 个工程化注入提示上的评估表明,注入成功率和策略违规率显著降低。我们提出了新的度量指标,包括注入成功率(Injection Success Rate, ISR)、策略覆盖频率(Policy Override Frequency, POF)、提示净化率(Prompt Sanitization Rate, PSR)和合规一致性得分(Compliance Consistency Score, CCS),以推导出一个综合的总注入漏洞得分(Total Injection Vulnerability Score, TIVS)。该系统利用 OVON(Open Voice Network)框架通过结构化 JSON 消息进行智能体间通信,将先前建立的多智能体架构从幻觉缓解扩展到应对提示注入的独特挑战。

关键词

引用

@article{arxiv.2503.11517,
  title  = {Prompt Injection Detection and Mitigation via AI Multi-Agent NLP Frameworks},
  author = {Diego Gosmar and Deborah A. Dahl and Dario Gosmar},
  journal= {arXiv preprint arXiv:2503.11517},
  year   = {2025}
}

备注

22 pages, 9 figures