中文

基于正、未标记与暴露数据的自动去偏学习

机器学习 2023-03-09 v1 机器学习

摘要

我们解决了带有正样本选择偏置的正未标记数据二分类(PU 分类)问题。在观测过程中,(i)样本暴露给用户,(ii)用户随后返回暴露样本的标签,(iii)然而我们只能观测到正样本。因此,我们观测到的正标签是暴露与标注二者的结合,这为观测正样本带来了选择偏置问题。该场景构成了许多实际应用(如推荐系统)的概念框架,我们称之为“从正、未标记与暴露数据学习”(PUE 分类)。为应对此问题,我们初始假设可访问带暴露标签的数据。随后,我们提出一种利用强可忽略性假设来辨识目标函数的方法,并开发了“自动去偏 PUE”(ADPUE)学习方法。该算法直接去偏选择偏置,无需如倾向得分等其他学习方法所需的中间估计。通过实验,我们证明该方法在多个半合成数据集上优于传统 PU 学习方法。

关键词

引用

@article{arxiv.2303.04797,
  title  = {Automatic Debiased Learning from Positive, Unlabeled, and Exposure Data},
  author = {Masahiro Kato and Shuting Wu and Kodai Kureishi and Shota Yasui},
  journal= {arXiv preprint arXiv:2303.04797},
  year   = {2023}
}