中文

响应依赖型标签缺失下的预测

机器学习 2021-03-26 v1 机器学习

摘要

在许多场景中,传感技术或其他采样机制的局限会导致标签缺失,其中训练集中标签缺失的概率数据是未知函数。例如,用于探测森林火灾的卫星无法感知低于某一尺寸阈值的火灾。在此类情况下,训练数据集由正样本与伪负样本观测组成,其中伪负样本可能是真负样本或未被探测到的小量级正样本。我们开发了一种新的方法论与非凸算法 P(ositive) U(nlabeled) - O(ccurrence) M(agnitude) M(ixture),利用对探测机制的先验知识联合估计正样本的出现概率与探测概率。我们的方法借鉴了正-无标签(PU)学习与零膨胀模型的思想,联合估计事件的量级与出现情况。我们给出了模型可辨识的条件,并证明尽管我们的方法导致非凸目标,任意局部极小化子具有最优统计误差(至多相差对数项),且投影梯度下降具有几何收敛速率。我们在合成数据与加州野火数据集上证明,我们的方法优于现有的 state-of-the-art 方法。

关键词

引用

@article{arxiv.2103.13555,
  title  = {Prediction in the presence of response-dependent missing labels},
  author = {Hyebin Song and Garvesh Raskutti and Rebecca Willett},
  journal= {arXiv preprint arXiv:2103.13555},
  year   = {2021}
}