中文

高维分类中的非参数特征增强与选择(FANS)

统计方法学 2015-01-05 v2 统计理论 应用统计 机器学习 统计理论

摘要

我们提出一种涉及非参数特征增强的高维分类方法。鉴于边缘密度比是最强的单变量分类器,我们利用密度比估计对原始特征测量值进行变换。随后,调用惩罚逻辑回归,以新生成或增强的特征作为输入。该过程训练出的模型兼具局部复杂性与全局简洁性,从而在避免维数灾难的同时构建出灵活的非线性决策边界。该方法被称为“非参数特征增强与选择”(Feature Augmentation via Nonparametrics and Selection, FANS)。我们通过推广朴素贝叶斯模型来阐释 FANS 的动机,将联合密度的对数比表示为边缘密度对数比的线性组合。该方法与广义加性模型相关,但具有更好的可解释性与可计算性。我们为 FANS 推导了风险界。在数值分析中,我们将 FANS 与竞争方法进行比较,以提供其最佳应用领域的指导。真实数据分析表明,FANS 在基准电子邮件垃圾邮件和基因表达数据集上表现出极强的竞争力。此外,FANS 通过并行计算由一种极快的算法实现。

关键词

引用

@article{arxiv.1401.0211,
  title  = {Feature Augmentation via Nonparametrics and Selection (FANS) in High Dimensional Classification},
  author = {Jianqing Fan and Yang Feng and Jiancheng Jiang and Xin Tong},
  journal= {arXiv preprint arXiv:1401.0211},
  year   = {2015}
}

备注

30 pages, 2 figures