重尾符号频率分布的相似性
物理与社会
2016-04-18 v2 计算与语言
数据分析、统计与概率
摘要
量化符号序列之间的相似性是信息论中的一个传统问题,需要比较不同序列中符号的频率。在从 DNA 到音乐再到文本等众多现代应用中,符号频率的分布以重尾分布(例如 Zipf 定律)为特征。这些分布中大量的低频符号给序列间相似性的估计带来了主要困难,例如它们阻碍了对熵的准确有限尺寸估计。在此,我们解析地展示了这些估计中的系统(偏差)与统计(涨落)误差如何依赖于样本大小 与重尾分布的指数 。我们的结果对 Shannon 熵 、其相应的相似性度量(例如 Jensen-Shanon 散度)以及基于 阶广义熵的度量均成立。对于小的 (包括 ),误差衰减慢于短尾分布中观察到的 衰减。对于大于临界值 的 ,则恢复 衰减。我们通过使用完整的 谱度量量化过去两个世纪英语语言的演变,展示了我们结果的实际意义。我们发现高频词比较低频词变化更慢,且 提供了量化语言变化的最稳健度量。
引用
@article{arxiv.1510.00277,
title = {Similarity of symbol frequency distributions with heavy tails},
author = {Martin Gerlach and Francesc Font-Clos and Eduardo G. Altmann},
journal= {arXiv preprint arXiv:1510.00277},
year = {2016}
}
备注
13 pages, 7 figures