评估数百个LLM代理的集体行为
多智能体系统
2026-02-19 v1
摘要
随着由LLM驱动的自主代理日益在社会中部署,理解其在社会困境中的集体行为变得至关重要。我们引入一个评估框架,使LLM生成编码为算法的策略,使其在部署前能够进行检查,并扩展至数百名代理的规模——远超以往工作的规模。我们发现,较新模型倾向于产生较差的社会结果,尤其是在代理优先考虑个人收益而非集体福利时。使用文化演化来建模用户对代理的选择,我们的仿真显示出在合作收益减小时以及人口规模增大时,向差异社会均衡收敛的显著风险。我们将代码作为评估套件发布,供开发人员评估其模型的新兴集体行为。
引用
@article{arxiv.2602.16662,
title = {Evaluating Collective Behaviour of Hundreds of LLM Agents},
author = {Richard Willis and Jianing Zhao and Yali Du and Joel Z. Leibo},
journal= {arXiv preprint arXiv:2602.16662},
year = {2026}
}