中文

基于标签特征在极端多标签分类中学习标签-标签相关性

机器学习 2024-05-09 v1 信息检索

摘要

极端多标签文本分类 (XMC) 涉及学习一个分类器,能够从数百万标签选项中为输入分配最相关标签子集。近期在该领域的研究越来越关注双方都以短文本为性质的对称问题设置。带标签特征的短文本 XMC 在查询-广告语料匹配、基于标题的产品推荐、相关搜索预测等领域找到了大量应用。本文提出了 Gandalf,一种新方法,利用标签共现图将标签特征作为额外数据点来补充训练分布。通过利用短文本 XMC 的特征,Gandalf 利用标签特征构建有效的训练实例,并使用标签图生成相应的软标签目标,从而有效捕获标签-标签之间的相关性。令人惊讶的是,尽管这些新的训练实例的数量不到原始数据集的一半,却能在针对尾部标签的 PSP@k 指标上超越原始数据集训练的模型。基于这一洞见,我们旨在在原始和新的训练实例上训练现有的 XMC算法,使 6 个最先进算法在 4 个由最高 13 万标签组成的基准数据集上平均提升约 5%。Gandalf 可以即插即用的方式应用于各种方法,从而在不增加额外计算开销的情况下推动该领域的技术进步。

关键词

引用

@article{arxiv.2405.04545,
  title  = {Learning label-label correlations in Extreme Multi-label Classification via Label Features},
  author = {Siddhant Kharbanda and Devaansh Gupta and Erik Schultheis and Atmadeep Banerjee and Cho-Jui Hsieh and Rohit Babbar},
  journal= {arXiv preprint arXiv:2405.04545},
  year   = {2024}
}