SLOPE的强筛选规则
机器学习
2024-05-14 v3 机器学习
统计计算
摘要
在观测数()远小于预测变量数()的数据集中提取相关特征是现代统计学的一大挑战。Sorted L-One Penalized Estimation(SLOPE)作为lasso的推广,是此情形下一种有前景的方法。然而,SLOPE当前的数值计算流程缺乏lasso相应工具所具有的效率,尤其在估计完整正则化路径方面。lasso效率的关键组成部分是预测变量筛选规则:允许在估计模型前丢弃预测变量的规则。本文首次为SLOPE建立此类规则。我们通过考察SLOPE的次微分发展了其筛选规则,并表明该规则是lasso强规则的推广。我们的规则是启发式的,即可能错误地丢弃预测变量。我们给出发生此种情况的条件,并表明这类情形罕见且可通过简单的最优性条件检验轻易防范。数值实验表明该规则在实践中表现良好,在领域带来数量级的改进,且在时不产生额外计算开销。我们还考察了设计矩阵中相关结构对该规则的影响,并讨论运用该规则的算法策略。最后,我们在R包SLOPE中提供了该规则的高效实现。
引用
@article{arxiv.2005.03730,
title = {The Strong Screening Rule for SLOPE},
author = {Johan Larsson and Małgorzata Bogdan and Jonas Wallin},
journal= {arXiv preprint arXiv:2005.03730},
year = {2024}
}
备注
15 pages, 5 figures