仅存在数据下的高维多类分类
统计方法学
2023-04-20 v1 统计理论
应用统计
统计理论
摘要
带有正类与未标记(PU)数据的分类频繁出现于生物信息学、临床数据与生态学研究中,其中收集负类样本可能极其昂贵。尽管先前关于 PU 数据的工作聚焦于二分类,本文中我们考虑多个正类标签这一实际重要且常见的设定。我们引入了多类 PU 模型与序数 PU 模型,分别适用于无序与有序标签。我们提出基于近端梯度下降的算法来最小化 l_{1,2} 惩罚的对数似然损失,并保障收敛至非凸目标的驻点。尽管仅存在数据和多类标签带来了棘手的非凸性,我们证明了在高维机制下真实参数邻域内驻点的统计误差界。这通过对该邻域内对数似然损失景观的细致刻画得以实现。此外,仿真与两个真实数据实验展示了我们的算法相较基线方法的经验优势。
引用
@article{arxiv.2304.09305,
title = {High-dimensional Multi-class Classification with Presence-only Data},
author = {Lili Zheng and Garvesh Raskutti},
journal= {arXiv preprint arXiv:2304.09305},
year = {2023}
}