基于逻辑回归方法增强正未标记数据的朴素分类器
机器学习
2023-06-06 v1 机器学习
摘要
我们认为,在完全随机选取(SCAR)假设下对正未标记(PU)数据进行分析时,将该问题视为对数据的错设模型拟合是有益的。具体而言,我们表明错设拟合的结果意味着:当响应的后验概率由逻辑回归建模时,将逻辑回归拟合到观测到的 PU 数据(该数据{\it 不}遵循此模型),仍会得到估计参数向量近似与真实参数向量共线。这一观察结合基于 F1 度量类比的优化来选取分类器截距,得到了一种分类器,其在所考虑的若干真实数据集上表现与同类方法相当或更优。
引用
@article{arxiv.2306.02798,
title = {Enhancing naive classifier for positive unlabeled data based on logistic regression approach},
author = {Mateusz Płatek and Jan Mielniczuk},
journal= {arXiv preprint arXiv:2306.02798},
year = {2023}
}