公平性与最大信息系数的理论基础
统计方法学
2015-05-13 v3 信息论
math.IT
统计理论
定量方法
机器学习
统计理论
摘要
最大信息系数(MIC)是一种在具有许多变量的数据集中寻找最强成对关系的工具(Reshef et al., 2011)。MIC很有用,因为它给不同但噪声水平相同的关系以相似的分数。这个性质称为“公平性”(equitability),对于分析高维数据集很重要。在这里,我们用估计理论的语言形式化了公平性和MIC背后的理论。这种形式化有许多优点。首先,它使我们能够证明公平性是统计独立性检验功效的推广。其次,它使我们能够计算和讨论MIC的总体值,我们称之为MIC_*。这样做,我们推广并加强了Reshef et al. (2011)中证明的数学结果,并澄清了MIC与互信息之间的关系。引入MIC_*还使我们能够更抽象地推理MIC的性质:例如,我们证明MIC_*是连续的,并且在某种意义上它是互信息的一种规范“平滑”。我们还证明了MIC_*的另一种等价刻画,我们用它来陈述新的估计量,以及在已知一对随机变量的联合概率密度函数时显式计算它的算法。我们希望本文为MIC和公平性提供更丰富的理论基础。本文将附有一篇即将发表的配套论文,该论文进行广泛的实证分析并与其他方法进行比较,讨论公平性以及MIC及其相关统计量使用的实际方面。
引用
@article{arxiv.1408.4908,
title = {Theoretical Foundations of Equitability and the Maximal Information Coefficient},
author = {Yakir A. Reshef and David N. Reshef and Pardis C. Sabeti and Michael Mitzenmacher},
journal= {arXiv preprint arXiv:1408.4908},
year = {2015}
}
备注
46 pages, 3 figures, 2 tables. This paper has been subsumed by arXiv:1505.02213 and arXiv:1505.02212. Please cite those papers instead