基于类特定置信度分数在域偏移下估计模型性能
计算机视觉与模式识别
2022-07-21 v1 机器学习
摘要
机器学习模型通常部署在与训练设置不同的测试环境中,可能因域偏移而导致模型性能下降。若我们能估计预训练模型在特定部署环境(例如某家诊所)数据上所能达到的性能,便可判断该模型能否安全部署,或其性能在该特定数据上是否出现不可接受的退化。现有方法基于部署域中无标签测试数据上预测结果的置信度进行估计。我们发现,现有方法难以应对存在类不平衡的数据,因为用于校准置信度的方法未考虑类不平衡所引入的偏差,从而无法估计各类别的准确率。本文在面向不平衡数据集的性能估计框架内引入类级别校准。具体而言,我们推导了包括温度缩放(TS)、置信度之差(DoC)与平均阈值化置信度(ATC)在内的最先进基于置信度的模型评估方法的类特定改进版本。我们还将该方法扩展至图像分割中 Dice 相似系数(DSC)的估计。我们在四项任务上开展实验,发现所提出的改进在不平衡数据集上一致地提升了估计精度。与自然域偏移下的分类任务相比,我们的方法将准确率估计提升了 18%,并在分割任务上将估计精度翻倍,优于先前方法。
引用
@article{arxiv.2207.09957,
title = {Estimating Model Performance under Domain Shifts with Class-Specific Confidence Scores},
author = {Zeju Li and Konstantinos Kamnitsas and Mobarakol Islam and Chen Chen and Ben Glocker},
journal= {arXiv preprint arXiv:2207.09957},
year = {2022}
}
备注
Accepted at MICCAI 2022