高维数据的多类别顶点判别分析
应用统计
2011-01-06 v1
摘要
为应对数据挖掘的挑战,判别分析作为统计学的一个重要分支仍在不断发展。我们近期提出的顶点判别分析(VDA)方法非常适合处理多类别以及预测变量数远超训练样本数的情况。本文探讨了VDA的一种扩展,该扩展可同时进行分类和变量选择。在VDA的损失函数中加入lasso(范数)和欧几里得惩罚项可以消除不必要的预测变量。Lasso惩罚分别作用于每个预测变量的系数;欧几里得惩罚则对单个预测变量的所有系数进行群组惩罚。引入这些惩罚项后,循环坐标下降法加速了所有系数的估计。我们在模拟数据和真实基准数据上的测试证明了惩罚VDA在高维环境下的模型构建和预测中的优势。
引用
@article{arxiv.1101.0952,
title = {Multicategory vertex discriminant analysis for high-dimensional data},
author = {Tong Tong Wu and Kenneth Lange},
journal= {arXiv preprint arXiv:1101.0952},
year = {2011}
}
备注
Published in at http://dx.doi.org/10.1214/10-AOAS345 the Annals of Applied Statistics (http://www.imstat.org/aoas/) by the Institute of Mathematical Statistics (http://www.imstat.org)