中文

正类未标注学习中非完全随机选取(PULSNAR):当 SCAR 假设不成立时的类比例估计

机器学习 2024-05-07 v3

摘要

正类与未标注(PU)学习是一种半监督二分类,机器学习算法区分一组正类实例(已标注)与一组同时含正负类的实例(未标注)。PU 学习在无法获得或难以获得确证负类、且从未标注中发现正类有价值(如从未测试化合物中发现可行药物)的场景中有广泛应用。多数 PU 学习算法做\emph{完全随机选取}(SCAR)假设,即正类的选取独立于其特征。然而在许多现实应用(如医疗)中,正类并非 SCAR(如重症更可能被诊断),导致对未标注中正类比例 α\alpha 的估计偏差及模型校准不佳,进而使选取正类的决策阈值不确定。PU 学习算法各异:有的仅估计未标注集中正类比例 α\alpha,有的计算各未标注实例为正的概率,部分二者皆可。我们提出两种 PU 学习算法以估计 α\alpha、计算 PU 实例的校准概率并改进分类指标:i) PULSCAR(完全随机选取正类未标注学习),ii) PULSNAR(非随机选取正类未标注学习)。PULSNAR 采用分治方法将 SNAR 正类聚为子类型,并对每类的正类与所有未标注应用 PULSCAR 来估计各子类型的 α\alpha。实验中,PULSNAR 在合成与真实基准数据集上均优于最先进方法。

关键词

引用

@article{arxiv.2303.08269,
  title  = {Positive Unlabeled Learning Selected Not At Random (PULSNAR): class proportion estimation when the SCAR assumption does not hold},
  author = {Praveen Kumar and Christophe G. Lambert},
  journal= {arXiv preprint arXiv:2303.08269},
  year   = {2024}
}