语义 F1 分数:模糊类别边界下的公平评估
人工智能
2025-09-29 v1
摘要
我们提出了语义 F1 分数,这是一种用于主观或模糊多标签分类的新型评估指标,用于量化预测标签与黄金标签之间的语义相关性。与将语义相关的预测视为完全失败的传统 F1 指标不同,语义 F1 引入了标签相似度矩阵来计算类软精确率和类软召回率分数,并由此推导出语义 F1 分数。与现有的基于相似度的指标不同,我们新颖的两步精确率-召回率公式能够比较任意大小的标签集,而不会丢弃标签或强制匹配不相似的标签。通过为语义相关但不完全相同的标签赋予部分分数,语义 F1 更好地反映了以人类分歧或模糊类别边界为特征的领域的现实情况。通过这种方式,它提供了更公平的评估:它认识到类别之间存在重叠,标注者之间存在分歧,并且基于相似预测的下游决策会导致相似的结果。通过理论论证和对合成及真实数据的广泛实证验证,我们表明语义 F1 展现出更高的可解释性和生态效度。因为它只需要一个对错误指定具有鲁棒性的、领域适用的相似度矩阵,而不需要僵化的本体,所以它可跨任务和模态应用。
引用
@article{arxiv.2509.21633,
title = {Semantic F1 Scores: Fair Evaluation Under Fuzzy Class Boundaries},
author = {Georgios Chochlakis and Jackson Trager and Vedant Jhaveri and Nikhil Ravichandran and Alexandros Potamianos and Shrikanth Narayanan},
journal= {arXiv preprint arXiv:2509.21633},
year = {2025}
}
备注
33 pages, 1 table, 29 figures, 4 algorithms