中文

灵活挖掘更优子群

机器学习 2015-10-29 v1 机器学习

摘要

在子群发现(也称为监督模式挖掘)中,发现高质量的一维子群及其细化是一项关键任务。对于标称属性,这相对直接,因为我们可以将单个属性值视为二元特征。对于数值属性,该任务更具挑战性,因为单个数值并非可靠的统计量。相反,我们可以考虑相邻值的组合,即分箱。然而,现有的分箱策略并非为子群发现量身定制。也就是说,它们不直接优化子群的质量,从而可能降低挖掘结果。为解决此问题,我们提出 FLEXI。简而言之,通过 FLEXI 我们提议使用最优分箱为数值和有序属性寻找高质量的二元特征。我们用各种质量度量实例化 FLEXI,并展示如何相应实现高效性。在合成与真实数据集上的实验表明,FLEXI 在子群质量上优于当前最优方法 (state of the art),最高提升达 25 倍。

关键词

引用

@article{arxiv.1510.08382,
  title  = {Flexibly Mining Better Subgroups},
  author = {Hoang-Vu Nguyen and Jilles Vreeken},
  journal= {arXiv preprint arXiv:1510.08382},
  year   = {2015}
}

备注

Submission to SDM 2016