中文

使用非凸融合惩罚建模高维分类数据

统计方法学 2021-12-21 v5 统计理论 统计计算 机器学习 统计理论

摘要

我们提出一种针对含名义分类数据的高维线性模型的估计方法。我们的估计量称为 SCOPE,通过使对应系数完全相等来融合各个水平。这是通过对分类变量系数的顺序统计量之差使用极小极大凹惩罚实现的,从而将系数聚类。我们给出了在单变量且可能具有很多水平情况下的非凸目标函数全局最小值的精确高效计算算法,并在多变量情形下将其用于块坐标下降过程。我们证明,只要真实水平具有某种最小分离度,利用未知水平融合的 oracle 最小二乘解是坐标下降的高概率极限点;已知这些条件在单变量情形下是极小的。我们在一系列真实与模拟数据集上展示了 SCOPE 的良好表现。在 CRAN 上提供了实现线性模型 SCOPE 以及逻辑回归版本的 R 包 CatReg。

关键词

引用

@article{arxiv.2002.12606,
  title  = {Modelling High-Dimensional Categorical Data Using Nonconvex Fusion Penalties},
  author = {Benjamin G. Stokell and Rajen D. Shah and Ryan J. Tibshirani},
  journal= {arXiv preprint arXiv:2002.12606},
  year   = {2021}
}

备注

52 pages, 10 figures; to appear in JRSSB