组件系统中普适多样性标度的替代路径:从蛋白质组到大型语言模型
统计力学
2026-07-02 v1
摘要
在广泛的复杂“组件系统”中,多样性标度及其波动表现出显著常见的统计规律。这些规律通常被解释为驱动组件多样性增长的潜在创新机制的标志,但其出现所需的基本要素仍知之甚少。特别是,从语言和技术制品到基因组和基因表达模式,不同组件的数量随系统规模呈亚线性增长,而其方差近似与其均值的平方成比例。这种行为在多样化的系统中是一致的,这引发了一个问题:是支撑多样性和创新的一般约束或涌现原理定义了具有不同组件数量的实现的架构。为了解决这个问题,我们在一大类增长模型中推导了这两种多样性定律联合涌现的解析条件,表明它们需要创新概率对多样性和系统规模的特定渐近依赖性。然后,我们证明相同的宏观定律出现在另一类具有潜在异质性的模型中,其中二次波动标度总是作为一般统计原理(本质上是总方差定律)的结果渐近涌现,而无需明确假设创新机制或任何特定的系统组装规则。我们将这些预测与来自语言、基因组、乐高构建和大型语言模型生成的文本的经验数据进行比较。我们的结果表明,经验多样性标度定律强烈约束生成模型,但不能唯一确定产生多样性的机制,揭示了创新驱动的增长模型与潜在变量描述之间的密切对应关系。
引用
@article{arxiv.2607.02221,
title = {Alternative routes to universal diversity scaling in component systems: from proteomes to large language models},
author = {Andrea Mazzolini and Leonardo Agasso and Filippo Valle and Michele Caselle and Marco Cosentino Lagomarsino and Matteo Osella},
journal= {arXiv preprint arXiv:2607.02221},
year = {2026}
}