数据集偏移下的广义贝叶斯量化学习
统计方法学
2021-02-18 v2
摘要
量化学习是利用在不同总体上训练的分类器预测来估计测试总体患病率的任务。量化方法假设分类器的灵敏度和特异度要么完美,要么可从训练总体迁移至测试总体。在存在数据集偏移、即训练总体中的误分类率不能代表测试总体时,这些假设是不恰当的。数据集偏移下的量化仅针对单类(分类)预测且假设完美知晓测试总体中一小部分真实标签的情形被研究过。我们提出广义贝叶斯量化学习(GBQL),其利用来自概率分类器的整体组合预测,并允许有限标注测试数据的真实类标签存在不确定性。我们不设定完整模型,而是采用基于仅一阶矩假设的组合数据无模型贝叶斯估计方程方法。该思想在贝叶斯组合数据分析中 generally 有用,因其对组合数据的不同生成机制具有鲁棒性,并将分类输出作为特例包含。我们展示了我们的方法如何将现有量化方法作为特例给出。讨论了使用多分类器预测、从而得到对包含劣质分类器具有鲁棒性的推断的集成 GBQL 扩展。我们概述了使用对损失函数的舍入与粗化近似的快速高效 Gibbs 采样器。我们还建立了 GBQL 的后验一致性、渐近正态性和区间估计的有效覆盖,以及有限样本后验集中率。GBQL 的经验性能通过仿真和对有明显数据集偏移的真实数据分析得到展示。
引用
@article{arxiv.2001.05360,
title = {Generalized Bayes Quantification Learning under Dataset Shift},
author = {Jacob Fiksel and Abhirup Datta and Agbessi Amouzou and Scott Zeger},
journal= {arXiv preprint arXiv:2001.05360},
year = {2021}
}
备注
59 pages, 15 figures