中文

大规模LLM人口中新兴协调的基准测试:在MoltBook档案库上的评估框架

介观与纳米尺度物理 2026-03-10 v2

摘要

随着多智能体大型语言模型(LLM)系统的规模不断扩大,对其新兴协调动态的评估变得越来越关键。然而,当前的评估范例——集中于单智能体或小型、明确结构化的群体——无法捕捉大规模、去中心化人口中出现的自组织和病毒式信息动态。我们引入了一个系统化的评估框架,用于基准测试开放智能体环境中的角色专化、信息扩散和合作任务解决。我们在MoltBook观测档案库(包含273万次与90704个自主智能体的互动)上演示了该框架,确立了新兴协调的定量基准。我们的评估显示,出现明显的核心-外围结构(轮廓系数0.91)、重尾级联分布(α=2.57),以及在去中心化任务解决中的严重协调开销(与单智能体基准的Cohen's d=-0.88)。通过提供标准化评估任务和实证基准,本框架使未来多智能体协议的严格比较成为可能,并将评估本身确立为科学研究的对象。

关键词

引用

@article{arxiv.2603.03554,
  title  = {Graphene Zero-Bias Sub-Terahertz Turnkey Detector with Above 43 GHz Bandwidth},
  author = {E. I. Titova and A. Titchenko and M. Titova and K. Shein and A. Kuksov and A. Sobolev and M. Kashchenko and M. Kravtsov and L. Elesin and K. S. Novoselov and G. Goltsman and D. A. Svintsov and I. Gayduchenko and D. A. Bandurin},
  journal= {arXiv preprint arXiv:2603.03554},
  year   = {2026}
}