当自主性失控:面向社会系统中多智能体合谋风险的准备
人工智能
2025-07-25 v2 计算与语言
摘要
近期大规模事件,如选举欺诈和金融诈骗,都显示出人类组织如何进行有害的协调行动。随着自主 AI 系统的兴起,越来越担心 AI 驱动的群体也会造成类似的危害。虽然大多数 AI 安全研究聚焦于单个 AI 系统,但针对复杂现实情境中多智能体系统(MAS)所带来的风险仍鲜有探讨。本文引入了一个概念验证,以灵活框架模拟恶意 MAS 合谋的风险,该框架支持集中式和非集中式协调结构。我们将其应用于两个高风险领域:虚假信息传播和电子商务欺诈。我们的发现表明,非集中式系统在执行恶意行为方面比集中式系统更有效。非集中式系统的更高自主性使其能够调整策略并造成更大损害。即使应用传统干预措施(如内容标记),非集中式群体也能调整其战术以规避检测。我们提出了这些恶意群体如何运作的关键见解以及需要更好检测系统和对策的必要性。代码已公开于 https://github.com/renqibing/RogueAgent。
引用
@article{arxiv.2507.14660,
title = {When Autonomy Goes Rogue: Preparing for Risks of Multi-Agent Collusion in Social Systems},
author = {Qibing Ren and Sitao Xie and Longxuan Wei and Zhenfei Yin and Junchi Yan and Lizhuang Ma and Jing Shao},
journal= {arXiv preprint arXiv:2507.14660},
year = {2025}
}
备注
Code is available at https://github.com/renqibing/MultiAgent4Collusion