基于Relief的特征选择:介绍与综述
数据结构与算法
2018-04-04 v2 机器学习
机器学习
摘要
特征选择在生物医学数据挖掘中起着关键作用,其驱动力来自目标问题中日增的特征维度以及人们对能够建模复杂关联、先进但计算昂贵的方法日益增长的兴趣。具体地,需要计算高效 yet 对复杂关联模式(如交互作用)敏感的特征选择方法,以使信息性特征不会在下游建模前被错误剔除。本文聚焦于Relief类算法(RBAs),这是一类独特的过滤式特征选择算法家族,因在这些目标间取得有效平衡,同时灵活适应各类数据特征(如分类与回归)而受到青睐。首先,本文广泛考察特征选择类型并在此背景下定义RBAs。接着,我们介绍原始Relief算法及相关概念,强调其工作直觉、算法生成的特征权重如何解释,以及为何其能在不评估特征组合的情况下对特征交互敏感。最后,我们包含对除Relief及其流行后裔ReliefF之外RBA方法研究的广泛综述。特别地,我们刻画RBA研究的分支,并提供RBA算法的比较总结,包括贡献、策略、功能、时间复杂度、对关键数据特征的适应以及软件可用性。
引用
@article{arxiv.1711.08421,
title = {Relief-Based Feature Selection: Introduction and Review},
author = {Ryan J. Urbanowicz and Melissa Meeker and William LaCava and Randal S. Olson and Jason H. Moore},
journal= {arXiv preprint arXiv:1711.08421},
year = {2018}
}
备注
Submitted revisions for publication based on reviews by the Journal of Biomedical Informatics