从不平衡数据中聚焦的 PU 学习
机器学习
2026-05-15 v1
摘要
我们提出了一种从高度不平衡数据集中的正例与无标签(PU)样本学习的新方法。由于标注数据有限,疾病基因识别、定向营销、欺诈检测和推荐系统等许多现实问题难以用机器学习方法解决。通常,训练数据包含正例和无标签实例,后者主要由负例组成,但也包含若干正例。尽管 PU 学习已被广泛研究,但鲜有方法能处理不平衡场景或与负例相似的难以检测的正例。我们的方法使用聚焦经验风险估计器,结合正例和无标签样本来训练二元分类器。实证评估表明,在两种标注机制——完全随机选择正例(SCAR)和随机选择(SAR)——下的不平衡数据集上,该方法取得了 SOTA 性能。除了这些受控实验外,我们还在财务错报检测这一实际应用中展示了所提方法的价值。
引用
@article{arxiv.2605.14467,
title = {Focused PU learning from imbalanced data},
author = {Elias Zavitsanos and Georgios Paliouras},
journal= {arXiv preprint arXiv:2605.14467},
year = {2026}
}