正和未标记数据:模型、估计、推断与分类
统计方法学
2025-02-25 v3 机器学习
摘要
本研究提出了一种新的解决正和未标记 (PU) 数据的方法,称为双指数倾斜模型 (DETM)。传统方法往往不足,因为它们仅适用于完全随机选择的 PU 数据 (SCAR),即假设标记的正样本和未标记的正样本来自相同的分布。相比之下,DETM 的双结构有效地 accommodates 来自不同分布的标记正样本和未标记正样本,这种情况更为复杂且较少探讨。我们严格建立了 DETM 的理论基础,包括可识别性、参数估计和渐近性质。此外,我们进一步进行统计推断,通过发展 SCAR 条件下的拟合度检验和构建目标域中正实例比例的置信区间。我们利用近似贝叶斯分类器进行分类任务,展示了 DETM 在预测中的稳健性能。通过理论洞见和实际应用,本研究突显了 DETM 作为解决 PU 数据挑战的综合框架。
引用
@article{arxiv.2407.09735,
title = {Positive and Unlabeled Data: Model, Estimation, Inference, and Classification},
author = {Siyan Liu and Chi-Kuang Yeh and Xin Zhang and Qinglong Tian and Pengfei Li},
journal= {arXiv preprint arXiv:2407.09735},
year = {2025}
}