中文

使用 R 包 MXM 进行特征选择:发现统计等价特征子集

机器学习 2016-11-11 v1 定量方法

摘要

统计等价签名(SES)算法是一种受贝叶斯网络基于约束的学习原理启发而产生的特征选择方法。当前大多数可用的特征选择方法仅返回单个特征子集,据称是预测能力最高的那个。我们认为在多个领域中,多个子集可以达到接近最大的预测精度,并且任意地仅提供一个会有若干缺陷。SES 方法试图识别多个预测性特征子集,其性能在统计上等价。在这方面,SES 涵盖并扩展了先前的特征选择算法,如最大最小父子孙算法。SES 在 R 包 MXM(代表 mens ex machina,拉丁语意为“来自机器的心智”)中的一个同名函数中实现。SES 的 MXM 实现处理若干数据分析任务,即分类、回归和生存分析。在本文中我们介绍 SES 算法、其实现,并提供 R 中 SES 函数使用的示例。此外,我们分析了三个公开可用的数据集,以说明 SES 检索到的签名的等价性,并将 SES 与最先进的特征选择方法 LASSO 进行对比。我们的结果提供了初步证据,表明两种方法在预测精度方面表现相当,并且多个同等预测性的签名实际上存在于真实世界数据中。

关键词

引用

@article{arxiv.1611.03227,
  title  = {Feature Selection with the R Package MXM: Discovering Statistically-Equivalent Feature Subsets},
  author = {Vincenzo Lagani and Giorgos Athineou and Alessio Farcomeni and Michail Tsagris and Ioannis Tsamardinos},
  journal= {arXiv preprint arXiv:1611.03227},
  year   = {2016}
}

备注

Accepted for publication in Journal of Statistical Software