正未标记数据的单样本与病例对照采样方案:两种场景的故事
机器学习
2026-04-08 v3
摘要
在本文中,我们论证了基于经验风险最小化(ERM)且针对病例对照采样方案设计的正未标记数据分类器,在应用于单样本场景时,其性能可能会显著恶化。我们揭示了为什么在除极特殊情况外的所有情况下,它们的行为都取决于场景。此外,我们引入了针对病例对照数据设计的流行非负风险分类器的单样本情形类比,并将其性能与原始方案进行了比较。我们表明它们之间存在显著差异,尤其是当一半或更多的正观测值被标记时。我们还考虑了相反的情况,即针对病例对照情形设计的 ERM 最小化器应用于单样本数据,并得出了类似的结论。考虑到场景的差异需要在经验风险的定义中做出一个唯一但关键的更改。
引用
@article{arxiv.2312.02095,
title = {Single-sample versus case-control sampling scheme for Positive Unlabeled data: the story of two scenarios},
author = {Jan Mielniczuk and Adam Wawrzeńczyk},
journal= {arXiv preprint arXiv:2312.02095},
year = {2026}
}