中文

Terrarium:用于多智能体安全、隐私与安全研究的黑板设计重访

人工智能 2025-10-17 v1 计算与语言 密码学与安全

摘要

由大型语言模型(LLM)驱动的多智能体系统(MAS)可以自动化诸如需要跨智能体协作的会议安排等繁琐用户任务。LLM 使能够考虑非结构化私人数据、用户约束和偏好的细致协议成为可能。然而,这种设计引入了新的风险,包括误差对齐和来自恶意方面的攻击,这些攻击可能会损害智能体或窃取用户数据。本文提出了用于 LLM 基于 MAS 安全、隐私和安全研究的Terrarium 框架。我们重新利用多智能体系统中的黑板设计,这是一种早期方法,创建用于多智能体协作的模块化、可配置测试平台。我们确定了关键攻击向量,如误差对齐、恶意智能体、受损通信和数据毒化。我们实现了三个具有四个代表性攻击的协作 MAS 场景,以展示框架的灵活性。通过提供工具来快速原型设计、评估和迭代防御和设计,Terrarium旨加速可信多智能体系统的进展。

关键词

引用

@article{arxiv.2510.14312,
  title  = {Terrarium: Revisiting the Blackboard for Multi-Agent Safety, Privacy, and Security Studies},
  author = {Mason Nakamura and Abhinav Kumar and Saaduddin Mahmud and Sahar Abdelnabi and Shlomo Zilberstein and Eugene Bagdasarian},
  journal= {arXiv preprint arXiv:2510.14312},
  year   = {2025}
}