中文

SureMap:面向单任务与多任务解聚评估的同时均值估计

机器学习 2024-11-18 v1 人工智能 应用统计 机器学习

摘要

解聚评估——即估计机器学习模型在不同子人群上的性能——是评估 AI 系统性能和群体公平性的核心任务。一个关键挑战在于评估数据稀缺,且由属性交叉(如种族、性别、年龄)产生的子人群往往非常小。如今,多个客户从模型开发者处采购同一 AI 模型已成常态,解聚评估的任务由每个客户单独面对。这引出了我们所谓的多任务解聚评估问题,即多个客户寻求在各自的数据设置(任务)中对给定模型进行解聚评估。本文开发了一种名为 SureMap 的解聚评估方法,该方法在单任务和多任务解聚评估黑盒模型时均具有高估计准确性。SureMap 的效率增益来自于:(1)将问题转化为结构化的同时高斯均值估计,以及(2)引入外部数据,例如来自 AI 系统创建者或其其他客户的数据。我们的方法结合了使用精心选择先验的最大后验 (MAP) 估计,以及通过 Stein 无偏风险估计 (SURE) 实现的无交叉验证调参。我们在多个领域的解聚评估任务上评估了 SureMap,观察到其相对于多个强基线有显著的准确性提升。

关键词

引用

@article{arxiv.2411.09730,
  title  = {SureMap: Simultaneous Mean Estimation for Single-Task and Multi-Task Disaggregated Evaluation},
  author = {Mikhail Khodak and Lester Mackey and Alexandra Chouldechova and Miroslav Dudík},
  journal= {arXiv preprint arXiv:2411.09730},
  year   = {2024}
}

备注

NeurIPS 2024