多标签 F-度量的凸校准替代损失
机器学习
2020-09-17 v1 机器学习
摘要
F-度量是多标签分类中广泛使用的性能度量,其中多个标签可同时在一个实例中激活(例如在图像标注中,任何图像中可有多个标签激活)。特别地,F-度量显式地平衡召回率(被预测为激活的激活标签所占比例)与精确率(被预测为激活的标签中实际激活所占比例),二者在评估多标签分类器整体性能时均很重要。然而,与大多数离散预测问题一样,直接优化 F-度量在计算上是困难的。本文探讨设计对 F-度量校准的凸替代损失的问题——具体地说,具有这样的性质:最小化替代损失(在充足数据的极限下)可得到 F-度量的贝叶斯最优多标签分类器。我们证明,当视为 损失矩阵时,-标签问题的 F-度量秩至多为 ,并应用 Ramaswamy 等人(2014)的结果设计了一族对 F-度量校准的凸替代损失。所得的替代风险最小化算法可视为将多标签 F-度量学习问题分解为 个二分类概率估计问题。我们还为我们的替代损失提供了定量遗憾转移界,使得二分类问题的任何遗憾保证可转移为多标签 F-度量问题的遗憾保证,并讨论了与 Dembczynski 等人(2013)算法的联系。我们的实验证实了我们的理论发现。
引用
@article{arxiv.2009.07801,
title = {Convex Calibrated Surrogates for the Multi-Label F-Measure},
author = {Mingyuan Zhang and Harish G. Ramaswamy and Shivani Agarwal},
journal= {arXiv preprint arXiv:2009.07801},
year = {2020}
}
备注
Accepted to ICML 2020