中文

基于社群的分层正无标记(PU)模型融合用于慢性病预测

机器学习 2023-09-08 v1 人工智能

摘要

正无标记(Positive-Unlabeled, PU)学习是一类二分类问题带来的挑战,其中存在大量无标记数据以及少量正类样本,可用于解决慢性病筛查问题。最先进的PU学习方法已催生出多种风险估计器,但它们忽视了不同人群之间的差异。为解决此问题,我们提出一种新颖的正无标记学习树(PUtree)算法。PUtree旨在慢性病预测任务中考虑如不同年龄或收入区间等社群因素。我们提出一种新颖的二分类决策方法,其分层构建基于社群的PU模型,随后聚合各模型输出。我们的方法可解释树上每个PU模型以实现优化的非叶PU节点划分。此外,一种掩码恢复数据增强策略使各社群内的模型得以充分训练。该方案还包含一个对抗式PU风险估计器以捕捉分层PU关系,以及一个融合每条树路径数据的模型融合网络,从而产生鲁棒的二分类结果。我们在两个基准数据集和一个新的糖尿病预测数据集上展示了PUtree及其变体的优越性能。

关键词

引用

@article{arxiv.2309.03386,
  title  = {Community-Based Hierarchical Positive-Unlabeled (PU) Model Fusion for Chronic Disease Prediction},
  author = {Yang Wu and Xurui Li and Xuhong Zhang and Yangyang Kang and Changlong Sun and Xiaozhong Liu},
  journal= {arXiv preprint arXiv:2309.03386},
  year   = {2023}
}

备注

Accepted by CIKM 2023 as a long paper