中文

l1惩罚参数M估计量的渐近分布与稀疏一致性:在线性SVM和逻辑回归中的应用

统计理论 2009-08-14 v1 统计理论

摘要

自早期用于最小二乘回归问题以来,l1惩罚框架已与涵盖回归、分类和生存分析的广泛损失函数相结合,用于变量选择。尽管l1惩罚最小二乘估计已有成熟理论,但针对一般损失函数的l1惩罚估计量的性质研究甚少。本文针对一大类惩罚函数和损失函数,推导了惩罚估计量的两个结果。第一个结果刻画了在经典设定(固定p、大n)下,对损失函数和惩罚函数施加温和条件时,惩罚参数M估计量的渐近分布。第二个结果给出了l1惩罚参数M估计量一致选择模型分量(稀疏一致性)及其符号(符号一致性)的充分必要条件——广义不可表示性条件。一般而言,广义不可表示性条件依赖于未知参数真值处风险函数的Hessian矩阵。在高斯预测变量下,我们得到一组条件,使得广义不可表示性条件可仅用预测变量的二阶矩重新表达。我们将理论应用于对比l1惩罚SVM和逻辑回归分类器,并找到了两者在模型选择一致性(稀疏一致性和符号一致性)上行为相同的条件。最后,基于这些分类示例,我们提供了理论的模拟证据。

关键词

引用

@article{arxiv.0908.1940,
  title  = {Asymptotic distribution and sparsistency for l1-penalized parametric M-estimators with applications to linear SVM and logistic regression},
  author = {Guilherme V. Rocha and Xing Wang and Bin Yu},
  journal= {arXiv preprint arXiv:0908.1940},
  year   = {2009}
}

备注

55 pages, 4 figures, also available as a technical report from the Statistics Department at Indiana University