基于划分信息的知识约简与发现
机器学习
2007-07-16 v1 数据库
信息论
math.IT
摘要
知识约简包括属性约简和值约简,是粗糙集文献中的重要课题。它也与机器学习和数据挖掘等其他领域密切相关。本文提出了一种名为 TWI-SQUEEZE 的算法。它能在两次扫描后找到一个约简,即不可约简的属性子集。本文给出了其正确性和计算复杂度,表明它是目前最快的算法。本文提出了一种多样性的度量,TWI-SQUEEZE 算法可被视为该度量的一个应用。作者还论证了该度量作为信息度量的正确性,使其能成为认知心理学文献中出现的“差异化”概念的统一度量。值约简是知识约简的另一个重要方面。有趣的是,使用相同的算法可以高效地执行完整的值约简。因此,完整的知识约简(结果是得到一个不可约简表)可以在四次扫描表后完成。约简的副产品是两种不同风格的分类器。本文将讨论各种案例和模型以证明该算法的效率和有效性。还将讨论一些主题,例如如何整合用户偏好以寻找局部最优属性子集。
关键词
引用
@article{arxiv.cs/0405104,
title = {Knowledge Reduction and Discovery based on Demarcation Information},
author = {Yuguo He},
journal= {arXiv preprint arXiv:cs/0405104},
year = {2007}
}
备注
93 pages with 46 figures