中文

极端多标签分类中面向长尾性能的广义测试效用

机器学习 2024-01-19 v2

摘要

极端多标签分类(XMLC)是从非常庞大的可能标签集中选出一小部分相关标签的任务。因此,它的特点是存在长尾标签,即大多数标签只有极少的正例。使用 precision@k 等标准性能指标时,分类器可以忽略尾部标签却仍报告良好的性能。然而,通常认为尾部中的正确预测更为“有趣”或“有价值”,但学界尚未就捕捉这一直观概念的度量达成共识。现有的倾向得分度量因混淆长尾与标签缺失问题而未能实现该目标。在本文中,我们分析在 k 处预算的广义度量作为一种替代方案。为解决优化这些度量的难题,我们将其表述于期望测试效用(ETU)框架中,该框架旨在优化固定测试集上的期望性能。我们推导了最优预测规则,并构建了具有可证明后悔保证及对模型误设鲁棒性的计算高效近似。我们基于块坐标上升的算法可轻松扩展到 XMLC 问题,并在长尾性能方面取得了有前景的结果。

关键词

引用

@article{arxiv.2311.05081,
  title  = {Generalized test utilities for long-tail performance in extreme multi-label classification},
  author = {Erik Schultheis and Marek Wydmuch and Wojciech Kotłowski and Rohit Babbar and Krzysztof Dembczyński},
  journal= {arXiv preprint arXiv:2311.05081},
  year   = {2024}
}

备注

This is the authors' version of the work accepted to NeurIPS 2023; the final version of the paper, errors and typos corrected, and minor modifications to improve clarity