语义分块与自然语言的熵
计算与语言
2026-02-19 v2 无序系统与神经网络
统计力学
人工智能
摘要
打印英文的熵率众所周知地估计为每字符约1比特,这一基准仅近期才被大型语言模型(LLMs)接近。这种熵率意味着英文相对于随机文本每字符预期的5比特含有约80%的冗余度。我们引入一种统计模型,旨在捕捉自然语言中复杂的多尺度结构,提供一种从原理上解释这种冗余度的途径。我们的模型描述了一种自相似地将文本分割为语义连贯块(直至单词级别)的程序。随后,文本的语义结构可被层次化分解,从而实现分析性处理。与现代LLMs和开放数据集的数值实验表明,我们的模型在语义层次的不同层级上定量地捕捉了真实文本的结构。我们模型预测的熵率与打印英文的估计熵率一致。此外,我们的理论进一步揭示,自然语言的熵率并非固定不变,而应随语义复杂度较高的语料库而系统性地增加,这种变化由我们模型中唯一的自由参数所捕捉。
引用
@article{arxiv.2602.13194,
title = {Semantic Chunking and the Entropy of Natural Language},
author = {Weishun Zhong and Doron Sivan and Tankut Can and Mikhail Katkov and Misha Tsodyks},
journal= {arXiv preprint arXiv:2602.13194},
year = {2026}
}
备注
29 pages, 9 figures; typos fixed