中文

正和未标记数据:模型、估计、推断与分类

统计方法学 2025-02-25 v3 机器学习

摘要

本研究提出了一种新的解决正和未标记 (PU) 数据的方法,称为双指数倾斜模型 (DETM)。传统方法往往不足,因为它们仅适用于完全随机选择的 PU 数据 (SCAR),即假设标记的正样本和未标记的正样本来自相同的分布。相比之下,DETM 的双结构有效地 accommodates 来自不同分布的标记正样本和未标记正样本,这种情况更为复杂且较少探讨。我们严格建立了 DETM 的理论基础,包括可识别性、参数估计和渐近性质。此外,我们进一步进行统计推断,通过发展 SCAR 条件下的拟合度检验和构建目标域中正实例比例的置信区间。我们利用近似贝叶斯分类器进行分类任务,展示了 DETM 在预测中的稳健性能。通过理论洞见和实际应用,本研究突显了 DETM 作为解决 PU 数据挑战的综合框架。

关键词

引用

@article{arxiv.2407.09735,
  title  = {Positive and Unlabeled Data: Model, Estimation, Inference, and Classification},
  author = {Siyan Liu and Chi-Kuang Yeh and Xin Zhang and Qinglong Tian and Pengfei Li},
  journal= {arXiv preprint arXiv:2407.09735},
  year   = {2025}
}