中文

多智能体系统中安全可信智能体AI的哨兵代理框架

人工智能 2025-09-19 v1 多智能体系统

摘要

本文提出了一种新颖的架构框架,旨在增强多智能体系统(MAS)中的安全性与可靠性。该框架的核心组件是哨兵代理(Sentinel Agents)网络,充当分布式安全层,集成大语言模型(LLM)语义分析、行为分析、检索增强验证和跨智能体异常检测等技术。这类代理可以监督智能体间通信、识别潜在威胁、执行隐私和访问控制,并维护全面的审计记录。与哨兵代理理念互补的是协调代理(Coordinator Agent)的使用。协调代理监督策略实施并管理智能体参与。此外,协调代理还接收来自哨兵代理的告警。基于这些告警,它可以调整策略、隔离或隔离行为不当的智能体,并控制威胁以维护 MAS 生态系统的完整性。这种双层安全方法结合了哨兵代理的持续监控与协调代理的治理功能,支持针对提示注入、智能体协作行为、大语言模型生成的幻觉、隐私泄露和协同多智能体攻击等多种威胁的动态自适应防御机制。除了架构设计外,我们还呈现了一项模拟研究,其中 162 次不同类别(提示注入、幻觉和数据外泄)的合成攻击被注入到多智能体对话环境中。哨兵代理成功检测到了攻击尝试,确认了所提监控方法的实际可行性。该框架还增强了系统可观测性,支持监管合规,并允许策略随时间演进。

关键词

引用

@article{arxiv.2509.14956,
  title  = {Sentinel Agents for Secure and Trustworthy Agentic AI in Multi-Agent Systems},
  author = {Diego Gosmar and Deborah A. Dahl},
  journal= {arXiv preprint arXiv:2509.14956},
  year   = {2025}
}

备注

25 pages, 12 figures