中文

计算符号源的熵率及一个无分布极限定理

信息论 2014-03-24 v2 机器学习 math.IT 概率论 统计计算 机器学习

摘要

顺序数据流的熵率自然地量化了生成过程的复杂性。因此,熵率波动可用作识别信号源中动态扰动的工具,且潜在地无需显式的背景噪声表征即可实施。然而,现有的熵率估计算法收敛速度显著缓慢,使得此类熵方法在实践中不可行。我们在此提出了一种根本性的新方法用于估计熵率,该方法在输入数据长度方面被证明收敛速度显著更快,并显示在从英文文本熵率估计到混沌动力系统复杂性估计等多种应用中均有效。此外,熵估计的收敛率不遵循任何标准极限定理,且已报道的算法未能提供计算值的任何置信界。利用与概率自动机理论的联系,我们建立了作为输入长度 s\vert s \vert 函数的 O(logs/s3)O(\log \vert s \vert/\sqrt[3]{\vert s \vert}) 收敛率,从而得出了显式的不确定性估计以及满足预设置信界所需的数据长度。

关键词

引用

@article{arxiv.1401.0711,
  title  = {Computing Entropy Rate Of Symbol Sources & A Distribution-free Limit Theorem},
  author = {Ishanu Chattopadhyay and Hod Lipson},
  journal= {arXiv preprint arXiv:1401.0711},
  year   = {2014}
}