WiS平台:通过基于游戏的分析增强对基于LLM的多智能体系统的评估
人工智能
2025-06-27 v2
摘要
基于大语言模型(LLM)的自主多智能体系统(MAS)的最新进展增强了应用场景,并提升了LLM处理复杂任务的能力。尽管已展现出有效性,但现有研究在基于LLM的MAS的评估、分析和可复现性方面仍存在明显困难。在本文中,为了促进基于LLM的MAS的研究,我们引入了一个开放、可扩展且实时更新的平台,用于基于游戏“谁是卧底?”(WiS)来访问和分析基于LLM的MAS。我们的平台具有三个主要价值:(1)统一的模型评估接口,支持Hugging Face上可用的模型;(2)用于模型评估的实时更新的排行榜;(3)涵盖游戏胜率、攻击、防御策略以及LLM推理能力的全面评估。为了严格测试WiS,我们进行了涵盖各种开源和闭源LLM的广泛实验,我们发现不同的智能体在游戏中表现出独特且有趣的行为。实验结果证明了我们的平台在评估基于LLM的MAS方面的有效性和效率。我们的平台及其文档可在 https://whoisspy.ai/ 公开获取。
引用
@article{arxiv.2412.03359,
title = {WiS Platform: Enhancing Evaluation of LLM-Based Multi-Agent Systems Through Game-Based Analysis},
author = {Chengwei Hu and Jianhui Zheng and Yancheng He and Hangyu Guo and Junguang Jiang and Han Zhu and Kai Sun and Yuning Jiang and Wenbo Su and Bo Zheng},
journal= {arXiv preprint arXiv:2412.03359},
year = {2025}
}