中文

基于 MDL 发现面向数值目标的最优子群列表

机器学习 2021-03-16 v1 机器学习

摘要

子群发现(SD)的任务是找到数据集中相对于目标属性而言突出的、可解释的子集描述。为解决挖掘大量冗余子群的问题,子群集合发现(SSD)被提出。然而,最先进的 SSD 方法存在局限,因为它们通常严重依赖启发式方法和/或用户选定的超参数。我们提出了一种基于最小描述长度(MDL)原理与子群列表的、具有离散度感知的子群集合发现问题表述。我们认为最佳子群列表是在给定目标总体分布下最能概括数据的列表。我们将焦点限制于单一数值目标变量,并表明我们的形式化在发现单个子群时与已有质量度量一致,但此外它允许在子群质量与子群复杂度之间进行权衡。我们接下来提出 SSD++,一种启发式算法,我们通过经验证明其返回最优子群列表:具有强偏离均值与小离散度的、非冗余的紧凑子群集合。

关键词

引用

@article{arxiv.2006.09186,
  title  = {Discovering outstanding subgroup lists for numeric targets using MDL},
  author = {Hugo M. Proença and Peter Grünwald and Thomas Bäck and Matthijs van Leeuwen},
  journal= {arXiv preprint arXiv:2006.09186},
  year   = {2021}
}

备注

Extended version of conference paper at ECML-PKDD