基于正、未标记与暴露数据的自动去偏学习
机器学习
2023-03-09 v1 机器学习
摘要
我们解决了带有正样本选择偏置的正未标记数据二分类(PU 分类)问题。在观测过程中,(i)样本暴露给用户,(ii)用户随后返回暴露样本的标签,(iii)然而我们只能观测到正样本。因此,我们观测到的正标签是暴露与标注二者的结合,这为观测正样本带来了选择偏置问题。该场景构成了许多实际应用(如推荐系统)的概念框架,我们称之为“从正、未标记与暴露数据学习”(PUE 分类)。为应对此问题,我们初始假设可访问带暴露标签的数据。随后,我们提出一种利用强可忽略性假设来辨识目标函数的方法,并开发了“自动去偏 PUE”(ADPUE)学习方法。该算法直接去偏选择偏置,无需如倾向得分等其他学习方法所需的中间估计。通过实验,我们证明该方法在多个半合成数据集上优于传统 PU 学习方法。
引用
@article{arxiv.2303.04797,
title = {Automatic Debiased Learning from Positive, Unlabeled, and Exposure Data},
author = {Masahiro Kato and Shuting Wu and Kodai Kureishi and Shota Yasui},
journal= {arXiv preprint arXiv:2303.04797},
year = {2023}
}