中文

是否使用 BEE:利用有偏熵估计器估计熵以外的量

信息论 2025-01-22 v1 软件工程 math.IT

摘要

熵估计在生物学、经济学、物理学、通信工程及其他学科中扮演着重要角色。它在软件工程中的应用日益增多,例如软件保密性、软件测试、预测分析、机器学习和软件改进。然而,在包括软件在内的许多情境下,精确估计已被证明是代价高昂的。因此,统计学家们开发了有偏估计器,旨在基于样本来准确估计熵。在本文中,我们将 18 种广泛使用的熵估计器应用于对软件工程师有用的香农测度:熵、互信息和条件互信息。此外,我们研究了样本量和定义域大小这两个主要影响因素对估计器的影响。我们的实验覆盖了大量随机生成的联合概率分布和变化的样本量,而非像以往研究那样仅选择一个或两个众所周知的概率分布。我们最重要的结果是发现 Chao-Shen 和 Chao-Wang-Jost 估计器表现突出,无论定义域大小如何,无论使用何种测度,它们都能始终如一地更快地收敛到真实值。随着样本量的增加,它们在准确性方面也往往优于其他估计器。这一发现能够在不牺牲性能的前提下显著减少数据收集工作量。

关键词

引用

@article{arxiv.2501.11395,
  title  = {To BEE or not to BEE: Estimating more than Entropy with Biased Entropy Estimators},
  author = {Ilaria Pia la Torre and David A. Kelly and Hector D. Menendez and David Clark},
  journal= {arXiv preprint arXiv:2501.11395},
  year   = {2025}
}