监控是否足够?面向多智能体讨论的隐蔽攻击的战略智能体选择
密码学与安全
2026-03-24 v1 人工智能
摘要
多智能体讨论已被广泛采用,推动了开发揭示其脆弱性的攻击方法的 efforts。本文研究了一种实用且鲜有人涉及的攻击场景,即讨论监控场景,其中异常检测器持续监控智能体间的通信并阻止检测到的恶意消息。虽然现有攻击在无讨论监控下有效,但我们展示它们在此类监控约束下表现出可检测模式, largely 失败。但这是否意味着仅靠监控即可确保多智能体讨论的安全?为回答此问题,我们开发了一种专为讨论监控场景量身定制的新型攻击方法。大量实验表明,即使在持续监控下,有效攻击仍然可能,表明监控alone 并不能消除对抗风险。
引用
@article{arxiv.2603.21194,
title = {Is Monitoring Enough? Strategic Agent Selection For Stealthy Attack in Multi-Agent Discussions},
author = {Qiuchi Xiang and Haoxuan Qu and Hossein Rahmani and Jun Liu},
journal= {arXiv preprint arXiv:2603.21194},
year = {2026}
}