中文

基于异常点检测与判别模式挖掘的特征构造框架

机器学习 2014-07-18 v1

摘要

无论监督学习算法的表达能力与复杂程度如何,其有效性都受限于描述数据的特征。这在机器学习领域并非新见解,且已开发出许多特征选择、变换与构造方法。然而,尽管针对特征选择与变换(即降维)的通用技术研究仍在持续,特征构造(即数据增强)工作目前主要局限于图像(尤其是字符)识别和自然语言处理领域。本文提出了一种新的通用特征构造框架。数据集中进行特征构造的需求由类别异常点指示,并利用判别模式挖掘在其 k-邻域上推导特征。我们使用 LOF 和 C4.5-Rules 实例化了该框架,并在多样化的 UCI 数据集集合上评估了所推导特征的效用。所推导的特征比由 DC-Fringe 推导的特征更常有用,且我们的方法过拟合的可能性要小得多。然而,虽然弱学习器 Naive Bayes 从特征构造中显著受益,但该效果对于 C4.5 而言不太明显,而对于 SVM 学习器则几乎消失。

关键词

引用

@article{arxiv.1407.4668,
  title  = {A feature construction framework based on outlier detection and discriminative pattern mining},
  author = {Albrecht Zimmermann},
  journal= {arXiv preprint arXiv:1407.4668},
  year   = {2014}
}