AI代理之间的秘密勾结:通过隐写术的多代理欺骗
人工智能
2025-07-28 v5 密码学与安全
摘要
大型语言模型近期能力的提升开启了通信生成式AI代理群体解决联合任务的应用。这带来了隐私和安全挑战,涉及信息的未经授权共享或其他不受欢迎的代理协调形式。现代隐写技术可能使此类动态难以检测。在本文中,我们通过借鉴AI和安全文献中的相关概念,全面形式化了生成式AI代理系统中秘密勾结的问题。我们研究了使用隐写术的动机,并提出了多种缓解措施。我们的研究结果形成了一个模型评估框架,系统性地测试了各种秘密勾结形式所需的能力。我们提供了一系列当代LLM的广泛实证结果。尽管当前模型的隐写能力仍然有限,但GPT-4显示出能力跃升,表明需要持续监控隐写前沿模型能力。最后,我们提出了一个全面的研究计划,以减轻未来生成式AI模型之间勾结的风险。
引用
@article{arxiv.2402.07510,
title = {Secret Collusion among AI Agents: Multi-Agent Deception via Steganography},
author = {Sumeet Ramesh Motwani and Mikhail Baranchuk and Martin Strohmeier and Vijay Bolina and Philip H. S. Torr and Lewis Hammond and Christian Schroeder de Witt},
journal= {arXiv preprint arXiv:2402.07510},
year = {2025}
}