超越单智能体安全:LLM间相互作用风险的分类学
多智能体系统
2025-12-03 v1 人工智能
摘要
本文考察了为何为人类-模型互动设计的安全机制无法扩展到大型语言模型(LLM)相互作用的环境。大多数当前的治理实践仍依赖于单智能体安全隔离、提示词、微调和监制层,这些机制约束单个模型行为,但未对多模型互动的动态提供治理。这些机制假设是二元设置:一个模型响应一个用户,受到稳定的监督。然而,研究和工业发展正快速转向LLM间生态系统,其中输出被递归地重新用作输入,跨越多个智能体的链条。此类系统中,局部合规即使在每个模型都单独对齐的情况下也可能聚合为集体失效。我们提出了从模型层面安全向系统层面安全的概念性转变,引入“Emergent Systemic Risk Horizon(ESRH)”框架,以正式化如何从互动结构而非孤立失误中引发不稳定。本文贡献包括:(i)对相互作用中集体风险的理论阐述,(ii)连接微观、中观和宏观层次失效模式的分类学,(iii)一种用于嵌入多智能体系统中自适应监督的设计方案——InstitutionalAI架构。
引用
@article{arxiv.2512.02682,
title = {Beyond Single-Agent Safety: A Taxonomy of Risks in LLM-to-LLM Interactions},
author = {Piercosma Bisconti and Marcello Galisai and Federico Pierucci and Marcantonio Bracale and Matteo Prandi},
journal= {arXiv preprint arXiv:2512.02682},
year = {2025}
}