中文

结合偏差校正校准的最大似然在标签偏移自适应中难以被超越

机器学习 2020-06-30 v5 机器学习

摘要

标签偏移指的是训练分布与测试分布之间先验类概率 p(y) 发生变化,而条件概率 p(x|y) 保持不变的现象。标签偏移出现在诸如医学诊断等场景中,其中训练用于根据症状预测疾病的分类器必须适应疾病基线患病率不同的情形。给定来自预测模型的 p(y|x) 估计值,Saerens 等人提出了一种高效的最大似然算法来纠正标签偏移,该算法不需要重新训练模型,但其一个限制性假设是 p(y|x) 经过校准,而现代神经网络并不满足这一点。最近,黑盒偏移学习(BBSL)与标签偏移下的正则化学习(RLLS)已成为在分类器不输出校准概率时应对标签偏移的先进(state-of-the-art)技术,但两种方法都需要使用重要性权重重新训练模型,且均未与最大似然方法进行基准比较。在此我们(1)表明,将最大似然与一种我们称之为偏差校正校准的校准方式相结合,在多种数据集和分布偏移上优于 BBSL 和 RLLS,(2)证明最大似然目标是凹的,以及(3)引入一种用于估计源域先验的系统性策略,可提升对不良校准的鲁棒性。本工作表明,带有适当校准的最大似然是标签偏移自适应中一个强大且高效的基线;复现实验的 notebook 可在 https://github.com/kundajelab/labelshiftexperiments 获取。

关键词

引用

@article{arxiv.1901.06852,
  title  = {Maximum Likelihood with Bias-Corrected Calibration is Hard-To-Beat at Label Shift Adaptation},
  author = {Amr Alexandari and Anshul Kundaje and Avanti Shrikumar},
  journal= {arXiv preprint arXiv:1901.06852},
  year   = {2020}
}

备注

ICML 2020