领先依赖性度量的实证研究
统计方法学
2018-03-28 v2 信息论
机器学习
math.IT
定量方法
机器学习
摘要
在探索性数据分析中,我们常感兴趣于识别有前景的成对关联以供进一步分析,同时滤除较弱、较无趣的关联。只要所使用的依赖性度量对不同类型的同等噪声关系赋予相似分数,这可以通过对所有变量对计算依赖性度量并检查得分最高的若干对来实现。这一性质称为公平性,在 Reshef 等人[2015b]中得以形式化。除公平性外,依赖性度量还可由其相应独立性检验的功效以及运行时间来评估。在此我们呈现对若干领先依赖性度量的公平性、针对独立性的功效和运行时间的广泛实证评估。其中包括 Reshef 等人[2015a]引入的两个统计量:以公平性为主要目标的 MICe,以及以针对独立性的功效为目标的 TICe。关于公平性,我们的分析发现,在我们考虑的大多数设定下,MICe 是函数关系上最公平的方法,尽管互信息估计在某些特定设定下在大样本量时证明是最公平的。关于针对独立性的功效,我们发现 TICe 与 Heller 和 Gorfine 的 S^DDP 在我们测试的关系上处于顶尖水平。我们的分析还显示了与 Reshef 等人[2015b]理论一致的针对独立性的功效与公平性之间的权衡。就运行时间而言,MICe 和 TICe 显著快于许多其他受测依赖性度量,且计算其中之一使得计算另一个变得平凡。这表明,一种快速而有用的、实现针对独立性的功效与公平性相结合的策略可能是先用 TICe 过滤关系,然后仅检查显著关系的 MICe。
引用
@article{arxiv.1505.02214,
title = {An Empirical Study of Leading Measures of Dependence},
author = {David N. Reshef and Yakir A. Reshef and Pardis C. Sabeti and Michael M. Mitzenmacher},
journal= {arXiv preprint arXiv:1505.02214},
year = {2018}
}
备注
David N. Reshef and Yakir A. Reshef are co-first authors, Pardis C. Sabeti and Michael M. Mitzenmacher are co-last authors