阈值化分类器以最大化 F1 分数
机器学习
2014-05-15 v2 信息检索
机器学习
摘要
本文提供了关于在二分类和多标签分类背景下最大化 F1 分数的新见解。F1 分数是精确率和召回率的调和平均数,广泛用于衡量当某一类稀有时二分类器的成功程度。微平均、宏平均和实例平均 F1 分数用于多标签分类。对于任何产生实值输出的分类器,我们推导了最佳可实现 F1 分数与实现该最优值的决策阈值之间的关系。作为一种特殊情况,如果分类器输出是校准良好的条件概率,则最优阈值是最优 F1 分数的一半。作为另一种特殊情况,如果分类器完全无信息,则最优行为是将所有样本分类为正类。由于正类样本的实际流行率通常较低,这种行为可能被视为不可取。作为一个案例研究,我们讨论了将该过程应用于预测 Medline 文档的 26,853 个标签时所得出的可能令人惊讶的结果。
引用
@article{arxiv.1402.1892,
title = {Thresholding Classifiers to Maximize F1 Score},
author = {Zachary Chase Lipton and Charles Elkan and Balakrishnan Narayanaswamy},
journal= {arXiv preprint arXiv:1402.1892},
year = {2014}
}