极端多标签分类器实则是层次化文本分类器:免费即得
计算与语言
2026-01-27 v3
摘要
为给定文本分配标签集是具有众多现实应用场景的问题,如推荐系统。两种独立研究流分支解决此问题。层次化文本分类(HTC)聚焦拥有数百条标签池、伴随语义标签层次结构的数据集。相比,极端多标签文本分类(XML)考虑极大标签集,最高可达数百万条,但无显式层次结构。在XML方法中,常在训练前或训练期构建人造层次结构以处理大标签空间。本文检验最先进HTC模型在XML数据集上进行训练与测试的表现,反之亦然,使用三个来自两大研究流的基准数据集。我们的实验表明,XML模型及其内部构建的层次结构非常有效地用作HTC模型。相比,HTC模型无法处理XML数据集的标签规模,实现的迁移效果较差。我们进一步论证,在HTC与XML之间进行公平比较时,应使用多个指标如F1,并辅以P@k和R-Precision。
引用
@article{arxiv.2411.13687,
title = {Your Extreme Multi-label Classifier is Secretly a Hierarchical Text Classifier for Free},
author = {Nerijus Bertalis and Paul Granse and Ferhat Gül and Florian Hauss and Leon Menkel and David Schüler and Tom Speier and Lukas Galke and Ansgar Scherp},
journal= {arXiv preprint arXiv:2411.13687},
year = {2026}
}