中文

仅利用正类训练数据的量化

机器学习 2021-10-14 v2 机器学习

摘要

量化(Quantification)是研究对未标记样本中属于各类别的数据点数量进行计数方法的研究领域。传统上,该领域研究者假定所有类别均有标记观测可用以归纳量化模型。然而,我们常面临类别数量庞大甚至未知,或仅拥有单一类别可靠数据的情况。当归纳多类量化器不可行时,我们往往关注于感兴趣特定类别的估计。在此背景下,我们提出了称为单类量化(OCQ)的新设定。相比之下,正类与未标记学习(PUL)作为机器学习的另一分支,虽量化并非PUL焦点,却已为OCQ提供了解决方案。本文弥合PUL与OCQ间的鸿沟,将两者在统一视角下结合。我们将所提方法被动攻击阈值(PAT)与PUL方法比较,表明PAT通常是最快且最准确的算法。PAT归纳的量化模型可复用以为不同数据样本量化。我们进一步引入穷举TIcE(ExTIcE),即PUL算法用于c估计的树归纳(TIcE)的改进版本。我们表明在若干负类观测与正类相同的场景中,ExTIcE比PAT及其他评估算法量化更准确。

关键词

引用

@article{arxiv.2004.10356,
  title  = {Quantifying With Only Positive Training Data},
  author = {Denis dos Reis and Marcílio de Souto and Elaine de Sousa and Gustavo Batista},
  journal= {arXiv preprint arXiv:2004.10356},
  year   = {2021}
}