DiSMEC——用于极端多标签分类的分布式稀疏机
机器学习
2016-09-09 v1 机器学习
摘要
极端多标签分类是指涉及数十万乃至数百万标签的监督多标签学习。极端分类中的数据集表现出对幂律分布的拟合,即很大一部分标签在数据分布中只有极少的正实例。大多数针对极端多标签分类的最先进方法试图通过将标签矩阵嵌入低维线性子空间来捕获标签间的相关性。然而,在存在幂律分布且极其庞大和多样的标签空间时,低秩等结构性假设很容易被破坏。在这项工作中,我们提出了 DiSMEC,这是一个大规模分布式框架,用于学习一对一多线性分类器,并结合显式容量控制以控制模型大小。与大多数最先进方法不同,DiSMEC 不对标签矩阵做任何低秩假设。利用双层并行化,DiSMEC 能够在几小时内为包含数十万标签的数据集学习分类器。显式容量控制机制过滤掉了虚假参数,在不损失预测精度的情况下保持了模型的紧凑性。我们在包含多达 670,000 个标签的公开真实数据集上进行了广泛的实证评估。我们将 DiSMEC 与近期最先进的方法进行了比较,包括 SLEEC(一种学习稀疏局部嵌入的领先方法)和 FastXML(一种优化基于排序的损失函数的树方法)。在某些数据集上,DiSMEC 能够显著提升预测精度——绝对值上比 SLEEC 高 10%,比 FastXML 高 15%。
引用
@article{arxiv.1609.02521,
title = {DiSMEC - Distributed Sparse Machines for Extreme Multi-label Classification},
author = {Rohit Babbar and Bernhard Shoelkopf},
journal= {arXiv preprint arXiv:1609.02521},
year = {2016}
}