中文

i.i.d. 序列模式熵的下界

信息论 2007-07-13 v1 math.IT

摘要

推导了独立同分布 (i.i.d.) 来源生成的序列模式熵的下界。模式是包含所有连续整数索引的索引序列,这些索引按首次出现的顺序递增。如果生成序列的源字母表未知,则不得不对未知字母表符号进行编码的必然成本可以被利用来创建该序列的模式。该模式可以自行进行压缩。此处推导的下界是函数形式的 i.i.d. 来源熵、字母表大小和字母概率。我们证明,对于大字母表,模式熵必须低于 i.i.d. 的熵。这种下降在许多情况下显著超过先前工作中推导的通用编码冗余下界。模式熵被限制在两个下界之间,这些下界取决于字母概率在概率空间中的排列。对于 very large 字母表,其大小可能大于编码模式的长度,所有低概率字母被打包到一个符号中。模式熵以 new packed 字母表的 i.i.d. 熵来上界和下界。为两个上界和下界提供了通常可以忽略的纠正项。

关键词

引用

@article{arxiv.cs/0504049,
  title  = {Bounds on the Entropy of Patterns of I.I.D. Sequences},
  author = {Gil I. Shamir},
  journal= {arXiv preprint arXiv:cs/0504049},
  year   = {2007}
}

备注

submitted to ITW2005