诊断工具分析(第二部分):盛行率、线性独立性与无监督学习
机器学习
2024-08-30 v1 机器学习
概率论
摘要
本文是两部曲中的第二篇,旨在通过诊断测试理解盛行率(即类中元素数量)、不确定性量化(UQ)与分类理论之间的联系。第一部分考虑了监督式机器学习(ML)的情境,建立了盛行率与相对条件概率概念之间的对偶关系。该分析的核心思路是通过最小化盛行率加权经验风险函数之和来训练一族判别式分类器。所得输出可解释为相对概率水平集,从而为类别标签提供不确定性估计。此程序还表明,某些判别式和生成式ML模型是等价的。第二部分考量了这些结果在无监督学习任务中的延伸情况,借助线性代数思想来实现。我们首先注意到,对于那些来自不纯净人群(即对应样本类别未知)的分布,可以以盛行率为参数进行描述。这促使我们提出线性独立人口的概念,这些人口具有不同的但未知的盛行率。借助此,我们识别了以不纯净人口和纯净人口中定义的分类器之间的同构关系。在某些情况下,这也导致非线性方程组,其解给出线性独立人口的盛行率,充分实现将无监督学习视为监督学习的泛化。我们在合成数据和一个仅供研究用的SARS-CoV-2酶联免疫吸附平板质量测定(ELISA)测试中展示了这些方法。
引用
@article{arxiv.2408.16035,
title = {Analysis of Diagnostics (Part II): Prevalence, Linear Independence, and Unsupervised Learning},
author = {Paul N. Patrone and Raquel A. Binder and Catherine S. Forconi and Ann M. Moormann and Anthony J. Kearsley},
journal= {arXiv preprint arXiv:2408.16035},
year = {2024}
}