中文

下一代 LLM 智能体系统合作的演化动力学:跨提供商的实证扩展

多智能体系统 2026-05-29 v1 人工智能 计算机科学与博弈论

摘要

下一代 LLM 智能体是否继承了其前任所记录的合作偏见,或者随着规模和提供商多样性的改变,是否重塑了竞争多智能体环境中的平衡行为?Willis等人使用进化博弈论和迭代囚徫困境(IPD),建立了一个此问题的基准,发现ChatGPT-4o和Claude 3.5 Sonnet中保持一致的合作偏见。我们将此基准扩展到2025-2026年发布的四个前沿模型——Claude Sonnet 4.6、Gemini 2.5 Flash、Gemini 3.1 Pro和GPT-5.4 Mini——在三个提示风格(默认、散文、自我精炼)和四种人口组成(平衡偏置、带噪声与无噪声)下应用相同的协议。合作偏见在提供商之间仍然存在(H1):在平衡无噪声条件下,九个十二个模型-提示组合都倾向于合作均衡。跨提供商差异显著(H3):Gemini 2.5 Flash在偏置条件下可达到最高77%的攻击性均衡,而GPT-5.4 Mini在自我精炼下可达到70%的合作均衡。对攻击能力平衡的支持是部分的(H2):自我精炼在所有模型中提升了IPD,Claude Sonnet 4.6 Refine 在数据集中实现了最高的IPD(0.913),但默认和散文提示没有系统性地缩小差距。关于噪声鲁棒性的证据是方向性的但未得到可靠确认(H4):在每个条件下进行500次莫森迭代后,Claude Sonnet 4.6的平均噪声灵敏度约为6个百分点,而Claude 3.5 Sonnet为13个百分点,但在考虑前任未报告的抽样误差后,这一跨研究差距并不显著。提供商身份而非模型代数是平衡结果的最强相关因子;无论模型规模或年代如何,噪声始终是一个普遍挑战。

关键词

引用

@article{arxiv.2605.29874,
  title  = {Evolutionary Dynamics of Cooperation in Next-Generation LLM Agent Systems: A Cross-Provider Empirical Extension},
  author = {Francisco León Zúñiga Bolívar},
  journal= {arXiv preprint arXiv:2605.29874},
  year   = {2026}
}

备注

10 pages, 3 figures, 8 tables. Extends Willis et al. (arXiv:2501.16173). Code and n=500 replication package: https://github.com/arqFranciscoLeon/evollm (archived: https://doi.org/10.5281/zenodo.20248615)