中文

伪线性性能度量优化理论:应用于 F-measure

机器学习 2018-01-03 v4

摘要

非线性性能度量被广泛用于评估学习算法。例如,FF-measure 是机器学习和信息检索社区中分类问题的常用性能度量。我们研究了一类称为伪线性性能度量的非线性性能度量的理论性质,其包括 FF-measure、Jaccard Index 等许多其他度量。我们确立了许多 FF-measure 和 Jaccard Index 的概念对于二分类、多类和多标签分类是每类假阴性和假阳性的伪线性函数。基于该观察,我们给出了此类性能度量优化问题到具有未知代价的代价敏感分类问题的一般归约。然后,我们提出一种具有可证明保证的算法,通过求解一系列代价敏感分类问题来获得 FF-measure 的近似最优分类器。我们分析的优势在于对任意数据集和任意分类器类成立,扩展了现有的关于伪线性度量的理论结果(那些本质上是渐近的)。我们还通过将算法与多目标优化中使用的加权和法相联系,确立了 FF-score 最大化问题的多目标性质。我们给出了数值实验,以说明在各种 FF-measure 优化任务中学习线性分类器时,代价不对称和阈值化的相对重要性。

关键词

引用

@article{arxiv.1505.00199,
  title  = {Theory of Optimizing Pseudolinear Performance Measures: Application to F-measure},
  author = {Shameem A Puthiya Parambath and Nicolas Usunier and Yves Grandvalet},
  journal= {arXiv preprint arXiv:1505.00199},
  year   = {2018}
}

备注

Extended Version of the NIPS 2014 Paper