中文

混合属性数据集中极大双聚类的高效挖掘

数据库 2017-10-11 v1

摘要

本文提出了一种新颖的枚举式双聚类算法,可直接在混合属性数据集(同时包含数值属性和分类属性)中挖掘所有极大双聚类,且无论是否存在缺失值。该提案是 RIn-Close_CVC 的扩展,后者最初被设计为仅从无缺失值的数值数据集中挖掘列上常值的完美或扰动双聚类。即使具备了附加的且更一般的特征,扩展后的 RIn-Close_CVC 仍保留了四个关键特性:(1)高效性,(2)完备性,(3)正确性,以及(4)非冗余性。我们的提案是首个无需任何预处理步骤(如对实值属性进行离散化和项化)即可处理混合属性数据集的方法。这是一个决定性方面,因为离散化和项化意味着先验决策,会导致信息损失且无法清晰控制其后果。另一方面,即使必须事先为每个数值属性指定一个单独的阈值(用于指示每个属性的内部一致性),每个阈值也将在双聚类构建过程中应用,从而塑造数据分布的独特性。我们还探索了双聚类与频繁模式挖掘之间的紧密联系,以(1)提供过滤器来选择具有高相关性和低冗余的紧凑双聚类集,以及(2)在带标签数据集的情况下,通过量化类关联规则,以用户友好且直观的方式自动呈现双聚类。我们的实验结果表明,双聚类生成了精简的相关规则集,为五个混合属性带标签数据集提供了有用且可解释的模型。

关键词

引用

@article{arxiv.1710.03289,
  title  = {Efficient mining of maximal biclusters in mixed-attribute datasets},
  author = {Rosana Veroneze and Fernando J. Von Zuben},
  journal= {arXiv preprint arXiv:1710.03289},
  year   = {2017}
}