F1 分数的置信区间:四种方法的比较
统计方法学
2024-06-11 v2
摘要
在自然语言处理(NLP)中,二分类算法常使用 F1 分数进行评估。由于样本 F1 分数是总体 F1 分数的估计值,仅报告样本 F1 分数而不说明其准确程度是不够的。置信区间表明了样本 F1 分数的准确程度。然而,大多数研究要么不报告置信区间,要么使用统计性质较差的方法进行报告。在本研究中,我回顾了构建总体 F1 分数置信区间的现有解析方法(即 Clopper-Pearson 方法和 Wald 方法),提出了两种新的解析方法(即 Wilson 直接法和 Wilson 间接法)来构建该区间,并基于覆盖概率与区间长度,以及这些方法是否遭受过冲与退化,对它们进行比较。理论结果表明,两种所提方法均不遭受过冲与退化。实验结果表明,就覆盖概率与区间长度而言,两种所提方法相对于现有方法表现更优。我在两个建议挖掘任务上展示了现有方法与所提方法。我讨论了这些结果的实践意义,并指出了未来研究的领域。
引用
@article{arxiv.2309.14621,
title = {Confidence Intervals for the F1 Score: A Comparison of Four Methods},
author = {Kevin Fu Yuan Lam and Vikneswaran Gopal and Jiang Qian},
journal= {arXiv preprint arXiv:2309.14621},
year = {2024}
}
备注
31 pages, 3 figures