面向大输出空间学习的随机负样本挖掘
机器学习
2018-10-17 v1 机器学习
摘要
我们考虑在输出空间规模非常大时,为给定输入检索最相关标签的问题。检索方法被建模为集合值分类器,其对每个输入输出一小部分类别集合,若真实标签不在输出集合中则视为出错。尽管该问题具有重要的实际意义,但一个在统计上严谨且实用的解决方案在很大程度上仍是缺失的。为此,我们首先定义了一族替代损失(surrogate loss),并证明在损失参数和数据分布的特定条件下它们是校准的且凸的,从而确立了使用这些损失的统计与分析基础。此外,我们在上述损失族中识别出一类特别直观的损失函数,并通过开发一种称为随机负样本挖掘(Stochastic Negative Mining)的技术,表明它们适于在大输出空间设定下进行实用实现(即无需评估所有标签的得分即可完成计算)。我们还给出了该损失族中损失的泛化误差界。最后,我们进行了实验,表明随机负样本挖掘相比常用的负采样方法具有优势。
引用
@article{arxiv.1810.07076,
title = {Stochastic Negative Mining for Learning with Large Output Spaces},
author = {Sashank J. Reddi and Satyen Kale and Felix Yu and Dan Holtmann-Rice and Jiecao Chen and Sanjiv Kumar},
journal= {arXiv preprint arXiv:1810.07076},
year = {2018}
}