中文

基于模型的度量:预测模型子群体性能的少样本高效估计

机器学习 2021-04-27 v1 机器学习 应用统计 统计方法学

摘要

机器学习模型——如今常开发用于筛查、诊断或预测健康状况——通过多种性能指标进行评估。评估模型实际效用的首要重要步骤是评估其在整个目标人群上的平均性能。在许多场景中,模型在预定义子群体中做出良好预测也至关重要。例如,证明模型公平或公正需要在不同人口统计子组中评估模型性能。然而,子群体性能指标通常仅使用该子组的数据计算,导致较小群体的估计方差更高。我们设计了一种测量子群体性能的流程,其可比典型的子样本估计更具样本效率。我们提出使用评估模型——一个描述预测模型得分条件分布的模型——来形成基于模型的度量(MBM)估计。我们的流程包含模型检验与验证,并提出了对传统非参数自助法的一种计算高效近似以构建置信区间。我们在两项主要任务上评估了MBM:一项可获取真实度量的半合成设置,以及一项真实世界的医院再入院预测任务。我们发现,对于小型子群体,MBM始终能产出更准确且方差更低的模型性能估计。

关键词

引用

@article{arxiv.2104.12231,
  title  = {Model-based metrics: Sample-efficient estimates of predictive model subpopulation performance},
  author = {Andrew C. Miller and Leon A. Gatys and Joseph Futoma and Emily B. Fox},
  journal= {arXiv preprint arXiv:2104.12231},
  year   = {2021}
}

备注

27 pages, 8 figures