多标签分类中基于梯度的标签分箱
机器学习
2021-06-23 v1
摘要
在多标签分类中,单个样本可能同时关联多个类标签,对此建模标签间依赖关系的能力被认为对有效优化不可分解评估度量(如子集 0/1 损失)至关重要。梯度提升框架为学习专门定制于此类损失函数的模型提供了研究充分的基石,且近期研究证实其在多标签设定下实现高预测精度的能力。许多近期提升方法所使用的二阶导数的利用,因将标签对信息纳入优化过程,有助于引导不可分解损失的极小化。其弊端是带来高昂计算成本,即便标签数量较少亦然。本文通过将一种新颖近似技术集成至提升过程,解决此类方法的计算瓶颈——求解线性方程组的需求。基于训练期间计算的导数,我们将标签动态分组为预定义数量的箱,以对线性系统的维数施加上界。我们使用一种已有的基于规则的算法的实验表明,这可在不显著损失预测性能的前提下加速训练。
引用
@article{arxiv.2106.11690,
title = {Gradient-based Label Binning in Multi-label Classification},
author = {Michael Rapp and Eneldo Loza Mencía and Johannes Fürnkranz and Eyke Hüllermeier},
journal= {arXiv preprint arXiv:2106.11690},
year = {2021}
}