Mandoline:分布偏移下的模型评估
机器学习
2022-04-12 v2
摘要
机器学习模型通常部署在与训练和验证时不同的设置中,这对希望预测已部署模型在目标分布上表现如何的从业者提出了挑战。如果可获得来自目标分布的无标签样本,以及来自可能不同的源分布的有标签样本,则可应用重要性加权等标准方法来估计目标上的性能。然而,当源和目标分布具有不重叠支撑或为高维时,重要性加权会遇到困难。受流行病学和民意调查等领域的启发,我们开发了Mandoline,一种缓解这些问题的新评估框架。我们的关键见解是,从业者可能拥有关于分布偏移方式的先验知识,我们可以利用这些知识更好地指导重要性加权过程。具体而言,用户编写简单的“切片函数”——有噪声的、可能相关的二元函数,旨在捕获可能的分布偏移轴——以计算重新加权的性能估计。我们进一步描述了一种用于切片的密度比估计框架,并展示其估计误差如何随切片质量和数据集大小缩放。在NLP和视觉任务上的实证验证表明,与标准基线相比,Mandoline可更准确地估计目标分布上的性能,最高达3倍。
引用
@article{arxiv.2107.00643,
title = {Mandoline: Model Evaluation under Distribution Shift},
author = {Mayee Chen and Karan Goel and Nimit S. Sohoni and Fait Poms and Kayvon Fatahalian and Christopher Ré},
journal= {arXiv preprint arXiv:2107.00643},
year = {2022}
}
备注
33 pages. Published as a conference paper at ICML 2021