中文

正则系综与微正则系综模型的描述长度

统计力学 2025-11-25 v4 数据分析、统计与概率

摘要

正则系综与微正则系综的(非)等价性是统计物理学中的一个基本问题,关乎在最大熵构造中使用软约束与硬约束是否导致对系统的相同描述。尽管最大熵模型也常用于统计推断、模式检测和假设检验,但对系综非等价性在统计建模上影响的完整理解仍然缺失。在此,我们通过最小描述长度(MDL)原理比较正则与微正则模型,从严格的模型选择视角研究该问题;MDL 原理给出了似然(衡量模型精度)与复杂度(衡量模型灵活性及其过拟合数据的潜力)之间的权衡。我们计算了两种表述的归一化最大似然(NML)并发现:(i) 微正则模型总是获得更高似然但总是更复杂;(ii) 最优模型选择取决于约束的经验值——当其对该观测数据的拟合超过其在所有实现上的均匀平均拟合时,正则模型表现最佳;(iii) 在热力学极限下,当系综等价成立时每节点的描述长度差消失,否则持续存在,表明非等价意味着大型正则与微正则模型间存在广延差异。最后,我们将 NML 方法与贝叶斯方法比较,表明 (iv) 先验的选择在等价模型中实际无关紧要,但在施加广延数量约束时变得关键,可能导致非常不同的结果。

关键词

引用

@article{arxiv.2307.05645,
  title  = {Description length of canonical and microcanonical models},
  author = {Francesca Giuffrida and Tiziano Squartini and Peter Grünwald and Diego Garlaschelli},
  journal= {arXiv preprint arXiv:2307.05645},
  year   = {2025}
}