sigmoidF1:一种用于多标签分类的平滑 F1 分数替代损失函数
机器学习
2022-11-01 v3 机器学习
摘要
多类多标签分类是通过预测为样本赋予多个标签的任务。当前模型将多标签设置简化为多个二分类或多类分类,从而允许使用现有的损失函数(sigmoid、交叉熵、逻辑损失等)。多标签分类的简化无法适应每个样本预测不同数量标签的情况,且其底层损失函数与性能指标的估计相差甚远。我们提出了一种损失函数 sigmoidF1,它是 F1 分数的近似,具有以下特点:(1) 平滑且适用于随机梯度下降,(2) 自然逼近多标签指标,(3) 估计标签倾向和标签数量。我们证明任何混淆矩阵指标都可以用平滑替代函数来表述。我们在文本和图像数据集上,并使用多种指标评估了所提出的损失函数,以应对多标签分类评估的复杂性。sigmoidF1 在一个文本和两个图像数据集以及多项指标上优于其他损失函数。这些结果表明,对于像多标签分类这样的非平凡分类问题,使用推理时的指标作为损失函数是有效的。
引用
@article{arxiv.2108.10566,
title = {sigmoidF1: A Smooth F1 Score Surrogate Loss for Multilabel Classification},
author = {Gabriel Bénédict and Vincent Koops and Daan Odijk and Maarten de Rijke},
journal= {arXiv preprint arXiv:2108.10566},
year = {2022}
}
备注
Published at TMLR