中文

PsySafe:一个基于心理学的多智能体系统安全攻击、防御与评估综合框架

计算与语言 2024-08-21 v3 人工智能 密码学与安全 多智能体系统

摘要

多智能体系统在增强大型语言模型 (LLMs) 后,展现出深厚的集体智能能力。然而,将此智能滥用于恶意目的构成了重大风险。迄今为止,关于多智能体系统相关安全问题的全面研究仍然有限。在本文中,我们通过智能体心理学这一创新视角探讨这些担忧,揭示了智能体的黑暗心理状态构成了重大的安全威胁。为解决这些问题,我们提出了一个基于智能体心理学的综合框架 (PsySafe),重点关注三个关键领域:首先,识别智能体中的黑暗人格特质如何导致风险行为;其次,从心理和行为角度评估多智能体系统的安全性;第三,制定有效的策略以减轻这些风险。我们的实验揭示了一些有趣的现象,例如智能体之间的集体危险行为、智能体在从事危险行为时的自我反思,以及智能体心理评估与危险行为之间的相关性。我们预期我们的框架和观察结果将为多智能体系统安全的进一步研究提供有价值的见解。我们将公开我们的数据和代码,地址为 https://github.com/AI4Good24/PsySafe。

关键词

引用

@article{arxiv.2401.11880,
  title  = {PsySafe: A Comprehensive Framework for Psychological-based Attack, Defense, and Evaluation of Multi-agent System Safety},
  author = {Zaibin Zhang and Yongting Zhang and Lijun Li and Hongzhi Gao and Lijun Wang and Huchuan Lu and Feng Zhao and Yu Qiao and Jing Shao},
  journal= {arXiv preprint arXiv:2401.11880},
  year   = {2024}
}

备注

ACL 2024