中文

荷兰抽签:构建二分类预测模型的通用基线

机器学习 2022-03-25 v1 性能 统计理论 统计方法学 机器学习 统计理论

摘要

新颖预测方法应始终与基线比较以了解其性能优劣。若无此参照系,模型的性能分数基本无意义。当一个模型在测试集上取得 0.8 的 F1F_1 意味着什么?需要一个恰当的基线来评估性能分数的“优劣”。与最新 SOTA 模型比较通常具有洞察力。然而,随着更新模型的出现,SOTA 地位可能迅速改变。与先进模型相反,可使用简单的虚拟分类器。但后者易被击败,使比较价值降低。本文提出一种适用于所有二分类模型的通用基线方法,称为荷兰抽签 (DD)。该方法对简单分类器进行加权并确定用作基线的最佳分类器。我们从理论上推导了众多常用评估度量下的 DD 基线,并表明在大多数情况下其退化为(几乎)总是预测为零或一。综上,DD 基线具有:(1) 通用性,因其适用于所有二分类问题;(2) 简单性,因其无需训练或调参即可快速确定;(3) 信息性,因可从结果得出有洞察的结论。DD 基线有两个用途。其一,通过这一鲁棒且通用的基线实现跨研究论文的比较。其二,在预测模型开发过程中提供健全性检查。当某模型被 DD 基线超越时,这是一个重大警告信号。

关键词

引用

@article{arxiv.2203.13084,
  title  = {The Dutch Draw: Constructing a Universal Baseline for Binary Prediction Models},
  author = {Etienne van de Bijl and Jan Klein and Joris Pries and Sandjai Bhulai and Mark Hoogendoorn and Rob van der Mei},
  journal= {arXiv preprint arXiv:2203.13084},
  year   = {2022}
}