中文

基于大语言模型驱动的多智能体在认知、适应性、理性与协作方面的探究

计算与语言 2024-11-28 v3

摘要

大语言模型(LLMs)已显著推进自然语言处理,展现出卓越的推理、工具使用与记忆能力。随着其应用扩展至多智能体环境,亟需一个全面评估框架以捕捉 LLMs 的推理、规划、协作及其他社会能力。本工作引入一种新颖的基于竞争的基准框架,专门设计用于评估多智能体设定下的 LLMs,提供量化指标以评估其判断、推理、欺骗、自我意识、合作、协调与理性。我们利用两款社会推理游戏与三种博弈论场景构建多样化环境。我们的框架借助概率图建模(PGM)方法增强,提升 LLMs 在复杂社会与认知维度中的能力。我们评估了七种 LLMs,定量揭示最强模型 GPT o1 与最弱模型 Llama-2-70B 之间存在超过三倍的能力差距。同时也证实我们的 PGM 增强使所有被选模型的能力平均提升 37%。我们的数据与代码见 https://github.com/cathyxl/MAgIC。

关键词

引用

@article{arxiv.2311.08562,
  title  = {MAgIC: Investigation of Large Language Model Powered Multi-Agent in Cognition, Adaptability, Rationality and Collaboration},
  author = {Lin Xu and Zhiyuan Hu and Daquan Zhou and Hongyu Ren and Zhen Dong and Kurt Keutzer and See Kiong Ng and Jiashi Feng},
  journal= {arXiv preprint arXiv:2311.08562},
  year   = {2024}
}

备注

EMNLP 2024