PULasso:面向仅存在数据的高维变量选择
统计方法学
2018-11-01 v3
摘要
在各类现实问题中,我们会遇到具有正类与未标记数据的分类问题,称为仅存在(presence-only)响应。本文研究在特征或协变量数 p 很大的仅存在响应情境下的变量选择。仅存在响应与高维度的结合带来了统计与计算上的双重挑战。本文提出 PUlasso 算法,用于仅存在正类与未标记响应的变量选择与分类。我们的算法采用 majorization-minimization(MM)框架,其为著名 expectation-maximization(EM)算法的推广。为使算法可扩展,我们针对标准 EM 算法给出了两种计算加速。我们提供了理论保证:首先证明算法收敛至驻点,然后证明在严格稀疏与组稀疏假设下,真参数局部邻域内的任意驻点均达到极小极大最优均方误差。模拟实验表明,在中等 p 设定下我们的算法在分类性能上优于 SOTA 算法。最后,我们在一项生物化学实例上展示了 PUlasso 算法的良好表现。
引用
@article{arxiv.1711.08129,
title = {PULasso: High-dimensional variable selection with presence-only data},
author = {Hyebin Song and Garvesh Raskutti},
journal= {arXiv preprint arXiv:1711.08129},
year = {2018}
}