中文

重尾符号频率分布的相似性

物理与社会 2016-04-18 v2 计算与语言 数据分析、统计与概率

摘要

量化符号序列之间的相似性是信息论中的一个传统问题,需要比较不同序列中符号的频率。在从 DNA 到音乐再到文本等众多现代应用中,符号频率的分布以重尾分布(例如 Zipf 定律)为特征。这些分布中大量的低频符号给序列间相似性的估计带来了主要困难,例如它们阻碍了对熵的准确有限尺寸估计。在此,我们解析地展示了这些估计中的系统(偏差)与统计(涨落)误差如何依赖于样本大小 NN 与重尾分布的指数 γ\gamma。我们的结果对 Shannon 熵 (α=1)(\alpha=1)、其相应的相似性度量(例如 Jensen-Shanon 散度)以及基于 α\alpha 阶广义熵的度量均成立。对于小的 α\alpha(包括 α=1\alpha=1),误差衰减慢于短尾分布中观察到的 1/N1/N 衰减。对于大于临界值 α=1+1/γ2\alpha^* = 1+1/\gamma \leq 2α\alpha,则恢复 1/N1/N 衰减。我们通过使用完整的 α\alpha 谱度量量化过去两个世纪英语语言的演变,展示了我们结果的实际意义。我们发现高频词比较低频词变化更慢,且 α=2\alpha=2 提供了量化语言变化的最稳健度量。

关键词

引用

@article{arxiv.1510.00277,
  title  = {Similarity of symbol frequency distributions with heavy tails},
  author = {Martin Gerlach and Francesc Font-Clos and Eduardo G. Altmann},
  journal= {arXiv preprint arXiv:1510.00277},
  year   = {2016}
}

备注

13 pages, 7 figures