中文

重新审视并重加权多标签排序中的单变量损失:一致性与泛化

机器学习 2021-05-12 v1 机器学习

摘要

(部分)排序损失是多标签分类常用的评价指标,通常为了计算效率而用凸替代损失进行优化。先前关于多标签排序的理论工作主要关注(Fisher)一致性分析。然而,现有理论与实践之间存在鸿沟——一些成对损失能带来良好性能但缺乏一致性,而一些单变量损失具有一致性但在实践中通常无明显优势。在本文中,我们尝试从学习算法的一致性与泛化误差界这两个互补视角出发,通过系统研究来填补这一鸿沟。我们的结果表明,采用一致单变量损失的学习算法的误差界为 O(c)O(c)cc 为标签数),而如先前工作所示,采用不一致成对损失的算法依赖于 O(c)O(\sqrt{c})。这解释了后者在实践中能比前者取得更好性能的原因。此外,我们提出了一种基于不一致重加权单变量损失的学习算法,其享有 O(c)O(\sqrt{c}) 的误差界,从而具备良好性能,同时拥有单变量损失的计算效率。最后,实验结果验证了我们的理论分析。

关键词

引用

@article{arxiv.2105.05026,
  title  = {Rethinking and Reweighting the Univariate Losses for Multi-Label Ranking: Consistency and Generalization},
  author = {Guoqiang Wu and Chongxuan Li and Kun Xu and Jun Zhu},
  journal= {arXiv preprint arXiv:2105.05026},
  year   = {2021}
}