发现具有统计显著性的属性交互
机器学习
2017-03-17 v2 机器学习
摘要
在许多数据探索任务中,识别特定于某个目标变量的属性交互组是有意义的。例如,在一个属性为医学标志物且目标变量(类变量)为表示疾病存在/不存在的二元变量的数据集中,我们希望了解哪些医学标志物相对于二元类标签存在交互。这些交互在多个实际应用中非常有用,例如用于深入了解数据结构、特征选择以及数据匿名化。我们提出了一种基于统计显著性检验的新方法,可用于验证数据集是否由给定的因子化类条件联合分布生成,其中该分布通过其属性的划分进行参数化。此外,我们提供了一种名为 ASTRID 的方法,用于自动寻找描述生成该数据的分布的属性划分。该方法利用最先进的分类器,通过系统地破坏属性交互并观察这种破坏对分类器性能的影响,来捕获数据中存在的交互。我们通过使用真实数据和合成数据的示例,实证展示了所提方法的实用性。
引用
@article{arxiv.1612.07597,
title = {Finding Statistically Significant Attribute Interactions},
author = {Andreas Henelius and Antti Ukkonen and Kai Puolamäki},
journal= {arXiv preprint arXiv:1612.07597},
year = {2017}
}
备注
9 pages, 4 tables, 1 figure