中文

利用语义信息G测度解释并扩展率失真函数与最大熵分布

信息论 2021-10-18 v1 math.IT

摘要

在率失真函数和最大熵方法中,最小互信息分布和最大熵分布由类贝叶斯公式表达,其中包含负指数函数和配分函数。为什么这些非概率函数会存在于类贝叶斯公式中?另一方面,率失真函数存在三个缺点:(1) 失真函数是主观定义的;(2) 实例与标签之间失真函数的定义通常很困难;(3) 它不能用于根据标签的语义进行数据压缩。作者此前已提出使用同时包含统计概率和逻辑概率的语义信息G测度。我们现在可以将负指数函数解释为真值函数,将配分函数解释为逻辑概率,将类贝叶斯公式解释为语义贝叶斯公式,将最小互信息解释为语义互信息,并将最大熵解释为极端最大熵减去语义互信息。为克服上述缺点,本文建立了真值函数与失真函数之间的关系,通过机器学习从样本中获取真值函数,并利用真值函数构建约束条件以扩展率失真函数。文中使用两个例子帮助读者理解最小互信息迭代并支持理论结果。利用真值函数和语义信息G测度,我们可以将机器学习与数据压缩(包括语义压缩)结合起来。我们需要进一步研究,以探索根据语义进行通用数据压缩与恢复。

关键词

引用

@article{arxiv.2110.07769,
  title  = {Using the Semantic Information G Measure to Explain and Extend Rate-Distortion Functions and Maximum Entropy Distributions},
  author = {Chenguang Lu},
  journal= {arXiv preprint arXiv:2110.07769},
  year   = {2021}
}

备注

22 pages, 5 figures