基于流的正-未标记学习有效方法:2-HNC
机器学习
2025-11-04 v2
摘要
在二分类的许多场景中,仅提供正实例于训练数据,剩余数据未标记。这种称为正-未标记 (PU) 学习的设置在这里由一种基于网络流的方法来解决,该方法利用样本之间的两两相似性。我们提出的方法 2-HNC 利用 Hochbaum 的归一化切割 (HNC) 以及由求解参数最小割问题所提供的一组解。该解集是将样本划分为两个集合的嵌套划分,对应于在两个目标之间进行权衡:集合内部的高内相似性和集合之间的低间相似性。这种嵌套序列被用于在此处提供未标记样本的排名,这些样本极可能为负类。基于这一洞见,我们的方法 2-HNC 分为两个阶段。第一个阶段在不假设任何负标签的情况下生成这一排名,使用仅受正标签样本约束的模型。第二个阶段将可能为负的样本纳入正集并重新计算分类。最终的标签预测从两个阶段中生成的所有划分中选择一个,使其正类比例最接近先验估计的该数量,这一数量被假设为给定。广泛的实验在合成数据和真实数据上表明,2-HNC 取得了强大的性能,常常超越了现有的 SOTA 算法。
关键词
引用
@article{arxiv.2505.08212,
title = {An Effective Flow-based Method for Positive-Unlabeled Learning: 2-HNC},
author = {Dorit Hochbaum and Torpong Nitayanont},
journal= {arXiv preprint arXiv:2505.08212},
year = {2025}
}