优化不可分解的性能度量:两类性能度量家族
机器学习
2015-05-27 v1 机器学习
摘要
现代分类问题经常呈现轻度至重度的标签不平衡以及对分类特性的特定要求,并且需要优化那些在数据集中不可分解的性能度量,例如 F-measure。此类度量引发了浓厚兴趣,并为学习算法带来特定挑战,因为其非加性本质阻碍了直接应用诸如随机梯度下降等被广泛研究的大规模优化方法。本文中我们揭示,对于可以表示为真正例率/真负例率函数的两个大型性能度量家族,确实可以实现逐点随机更新。我们考虑的家族是 TPR、TNR 的凹函数与伪线性函数,涵盖了若干广泛使用的性能度量如 F-measure、G-mean 和 H-mean。我们的核心贡献是针对这些家族的一种自适应线性化方案,利用该方案我们开发了能够实现真正基于点的随机更新的优化技术。对于凹性能度量,我们提出 SPADE,一种随机原始对偶求解器;对于伪线性度量,我们提出 STAMP,一种随机交替最大化过程。两种方法均具有清晰的收敛保证,展现出相对于现有方法的显著加速——通常达到一个数量级或更多,并且在测试数据上给出相似或更准确的预测。
引用
@article{arxiv.1505.06812,
title = {Optimizing Non-decomposable Performance Measures: A Tale of Two Classes},
author = {Harikrishna Narasimhan and Purushottam Kar and Prateek Jain},
journal= {arXiv preprint arXiv:1505.06812},
year = {2015}
}
备注
To appear in proceedings of the 32nd International Conference on Machine Learning (ICML 2015)