中文

高维数据的多类别顶点判别分析

应用统计 2011-01-06 v1

摘要

为应对数据挖掘的挑战,判别分析作为统计学的一个重要分支仍在不断发展。我们近期提出的顶点判别分析(VDA)方法非常适合处理多类别以及预测变量数远超训练样本数的情况。本文探讨了VDA的一种扩展,该扩展可同时进行分类和变量选择。在VDA的损失函数中加入lasso(1\ell_1范数)和欧几里得惩罚项可以消除不必要的预测变量。Lasso惩罚分别作用于每个预测变量的系数;欧几里得惩罚则对单个预测变量的所有系数进行群组惩罚。引入这些惩罚项后,循环坐标下降法加速了所有系数的估计。我们在模拟数据和真实基准数据上的测试证明了惩罚VDA在高维环境下的模型构建和预测中的优势。

关键词

引用

@article{arxiv.1101.0952,
  title  = {Multicategory vertex discriminant analysis for high-dimensional data},
  author = {Tong Tong Wu and Kenneth Lange},
  journal= {arXiv preprint arXiv:1101.0952},
  year   = {2011}
}

备注

Published in at http://dx.doi.org/10.1214/10-AOAS345 the Annals of Applied Statistics (http://www.imstat.org/aoas/) by the Institute of Mathematical Statistics (http://www.imstat.org)