二元时间序列熵的估计:方法、部分理论及模拟研究
信息论
2015-05-13 v1 math.IT
统计理论
统计理论
摘要
受神经科学中熵估计问题的部分启发,我们对实践中一些最流行且有效的熵估计方法进行了详细而广泛的比较:插件法(plug-in method)、四种基于 Lempel-Ziv (LZ) 数据压缩算法族的估计器、一种基于上下文树加权(Context-Tree Weighting, CTW)方法的估计器,以及更新熵估计器。**方法。** 引入了三种新的熵估计器。对于四种基于 LZ 的估计器中的两种,描述了一种用于评估其标准误的 bootstrap 过程,并启发式地推导出一条用于选择其参数值的实用经验法则。**理论。** 我们证明了,与其早期版本不同,这两种新的基于 LZ 的估计器对于任何有限值、平稳且遍历的过程都是一致的。推导了一种有效方法,用于精确近似具有已知分布的有限状态隐马尔可夫模型(HMM)的熵率。提出了启发式计算,并导出了用于评估每种估计器的偏差和标准误的近似公式。**模拟。** 将所有估计器应用于由众多不同过程生成的广泛数据,这些过程具有不同程度的依赖性和记忆性。从这些实验中得出的一些结论包括:(i) 对于所有考虑的估计器,误差的主要来源是偏差。(ii) CTW 方法被反复且一致地观察到能提供最准确的结果。(iii) 基于 LZ 的估计器的性能通常可与插件法相媲美。(iv) 插件法的主要缺点是其计算效率低下。
引用
@article{arxiv.0802.4363,
title = {Estimating the entropy of binary time series: Methodology, some theory and a simulation study},
author = {Y. Gao and I. Kontoyiannis and E. Bienenstock},
journal= {arXiv preprint arXiv:0802.4363},
year = {2015}
}
备注
34 pages, 3 figures