大语言模型的统计信标
计算与语言
2026-02-23 v1 计算机与社会
物理与社会
摘要
大型语言模型通过从高维分布中进行概率抽样生成文本,然而这种过程如何重塑语言的结构统计组织仍在不完全 characterize。本文表明,无损压缩提供了一种简单且不依赖模型的统计规律性度量,可直接从surface text中区分生成的体系结构。我们分析了压缩行为在三个逐步更复杂的信息生态系统中的表现:受控的人类-LLM续写、知识基础设施的生成性调解(维基百科 vs. Grokipedia),以及完全合成的社交交互环境(Moltbook vs. Reddit)。在所有情境下,压缩揭示了概率生成的持续结构信标。在受控和中介情境中,LLM生成的语言比人类编写的文本表现出更高的结构规律性和可压缩性,这符合于高度重复的统计模式中集中输出的观察。然而,该信标显示出尺度依赖性:在碎片化交互环境中,分离度减弱,这表明在小尺度下表层可区分性存在基本限制。这种可压缩性分离在不同模型、任务和领域中 consistently 出现,且可直接从surface text观察到,无需依赖模型内部或语义评估。总体而言,我们的发现引入了一种简单且稳健的框架,用于量化生成系统如何重塑文本生产,提供了关于通信复杂度演变的结构视角。
引用
@article{arxiv.2602.18152,
title = {The Statistical Signature of LLMs},
author = {Ortal Hadad and Edoardo Loru and Jacopo Nudo and Niccolò Di Marco and Matteo Cinelli and Walter Quattrociocchi},
journal= {arXiv preprint arXiv:2602.18152},
year = {2026}
}