确定自然序列中估计熵所需的样本数量
信息论
2018-05-24 v1 math.IT
统计理论
数据分析、统计与概率
统计理论
摘要
计算符号序列的香农熵已在许多领域被广泛考虑。对于诸如估计英语语言文本的 N-gram 熵等描述性统计问题,常用方法是使用尽可能多的数据以获得逐步更精确的估计。然而在某些情况下,可能仅能获得短序列。这就引出了需要多少样本才能计算熵的问题。在本文中,我们考察该问题并提出了一种估计计算一组排序符号自然事件的香农熵所需样本数量的方法。该结果利用修正的 Zipf-Mandelbrot 律和 Dvoretzky-Kiefer-Wolfowitz 不等式得出,我们提出了一种算法,可给出在给定置信水平和精度下获得熵估计所需的最小样本数量估计。
引用
@article{arxiv.1805.08929,
title = {Determining the Number of Samples Required to Estimate Entropy in Natural Sequences},
author = {Andrew D. Back and Daniel Angus and Janet Wiles},
journal= {arXiv preprint arXiv:1805.08929},
year = {2018}
}