基于倾向得分的概率标签树
机器学习
2021-10-22 v1 信息检索
摘要
极端多标签分类(XMLC)指的是从极大规模的可能标签集中为实例标注相关标签小子集的任务。近来,XMLC 已广泛应用于自动内容标注、在线广告或推荐系统等多种网络应用。在此类环境中,标签分布常高度不平衡,主要由非常稀有的长尾标签构成,且相关标签可能缺失。作为这些问题的补救,倾向模型被提出并应用于若干 XMLC 算法中。本工作中,我们关注在概率标签树(一种流行的 XMLC 问题方法)下该模型的最优预测问题。我们引入一种基于 -search 算法的推断过程,在假设所有概率与倾向均已知时高效找到最优解。我们在流行的 XMLC 基准数据集上通过广泛实证研究展示了该方法的吸引力。
引用
@article{arxiv.2110.10803,
title = {Propensity-scored Probabilistic Label Trees},
author = {Marek Wydmuch and Kalina Jasinska-Kobus and Rohit Babbar and Krzysztof Dembczyński},
journal= {arXiv preprint arXiv:2110.10803},
year = {2021}
}
备注
The extended version of SIGIR '21 Short Research Paper