灵活挖掘更优子群
机器学习
2015-10-29 v1 机器学习
摘要
在子群发现(也称为监督模式挖掘)中,发现高质量的一维子群及其细化是一项关键任务。对于标称属性,这相对直接,因为我们可以将单个属性值视为二元特征。对于数值属性,该任务更具挑战性,因为单个数值并非可靠的统计量。相反,我们可以考虑相邻值的组合,即分箱。然而,现有的分箱策略并非为子群发现量身定制。也就是说,它们不直接优化子群的质量,从而可能降低挖掘结果。为解决此问题,我们提出 FLEXI。简而言之,通过 FLEXI 我们提议使用最优分箱为数值和有序属性寻找高质量的二元特征。我们用各种质量度量实例化 FLEXI,并展示如何相应实现高效性。在合成与真实数据集上的实验表明,FLEXI 在子群质量上优于当前最优方法 (state of the art),最高提升达 25 倍。
引用
@article{arxiv.1510.08382,
title = {Flexibly Mining Better Subgroups},
author = {Hoang-Vu Nguyen and Jilles Vreeken},
journal= {arXiv preprint arXiv:1510.08382},
year = {2015}
}
备注
Submission to SDM 2016