中文

论非线性压缩代价:当香农遇见 Rényi

信息论 2024-06-10 v1 数据结构与算法 math.IT 数据分析、统计与概率

摘要

香农熵是无损压缩器通过编码独立同分布符号所能达到的最短平均码字长度。然而,在某些情况下,目标是最小化码字的指数平均长度,即当编码/解码代价随码字长度呈指数增长时。最优性由所有如下策略达到:将概率为 pip_i 生成的每个符号 xix_i 映射为长度 D(q)(i)=logDpiqj=1Npjq\ell^{(q)}_D(i)=-\log_D\frac{p_i^q}{\sum_{j=1}^Np_j^q} 的码字。这导致最小指数平均码字长度,其等于信源分布的 Rényi 熵而非香农熵。我们将既有的算术编码(AC)压缩器推广到该框架。我们分析表明,若待编码符号为独立同分布,则我们的广义算法提供的指数平均长度可任意接近 Rényi 熵。随后我们将算法应用于模拟(独立同分布生成)和真实(一段维基百科文本)数据集。正如预期,我们发现应用于独立同分布数据印证了我们的分析结果;我们还发现,当应用于真实数据集(由高度相关符号组成)时,相对于经典的“香农式”压缩器,我们的算法仍能有效降低指数平均码字长度。此外,我们给出了使用指数平均的另一种理由:即我们表明,通过最小化指数平均长度,可以最小化码字超过某一阈值长度的概率。该关系依赖于指数平均与信源分布累积量生成函数之间的联系,而后者又与大偏差概率相关。我们在模拟和真实数据集上再次测试并确认了我们的结果。

关键词

引用

@article{arxiv.2310.18419,
  title  = {On nonlinear compression costs: when Shannon meets R\'enyi},
  author = {Andrea Somazzi and Paolo Ferragina and Diego Garlaschelli},
  journal= {arXiv preprint arXiv:2310.18419},
  year   = {2024}
}

备注

22 pages, 9 figures