可信 LLM 智能体综述:威胁与对策
多智能体系统
2025-03-14 v1 计算机与社会
摘要
随着大语言模型(LLM)的快速发展,基于 LLM 的智能体和多智能体系统(MAS)已显著扩展了 LLM 生态系统的能力。这种演进源于赋予 LLM 额外模块,如记忆、工具、环境乃至其他智能体。然而,这一进步也引入了更复杂的可信度问题,以往仅关注 LLM 的研究无法涵盖。本综述提出了 TrustAgent 框架,系统研究智能体的可信度问题,特点包括模块化分类、多维内涵和技术实现。通过彻底调查和总结新出现的攻击、对策和评估方法,本文将可信 LLM 的概念扩展到可信智能体这一新兴范式。TrustAgent 中,我们首先分解并介绍了智能体和 MAS 的各种组件。随后,将其可信度划分为内在(大脑、记忆和工具)和外在(用户、智能体和环境)两个方面。随后,本文阐述了可信度的多层次含义,并详述了与这些内部和外部模块相关的现有研究的实现技术。最后,本文提出我们的见解和展望,旨为未来工作提供指导。
引用
@article{arxiv.2503.09648,
title = {A Survey on Trustworthy LLM Agents: Threats and Countermeasures},
author = {Miao Yu and Fanci Meng and Xinyun Zhou and Shilong Wang and Junyuan Mao and Linsey Pang and Tianlong Chen and Kun Wang and Xinfeng Li and Yongfeng Zhang and Bo An and Qingsong Wen},
journal= {arXiv preprint arXiv:2503.09648},
year = {2025}
}