基于分类法感知并行学习的极端多标签补全用于语义文档标注
机器学习
2024-12-19 v1
摘要
在极端多标签补全(XMLCo)中,目标是预测文档集合中缺失的标签。与 XML 分类一起,XMLCo 可以说是最具挑战性的文档分类任务之一,因为与训练数据集中可用的已标注文档数量相比,标签的数量(至少数万个)通常非常庞大。此类任务通常伴随着一个编码标签有机关系的分类法,并且已经提出了许多方法来利用这种层次结构以改善 XMLCo 算法的结果。在本文中,我们提出了一种解决该问题的新方法 TAMLEC(用于极端多标签补全的分类法感知多任务学习)。TAMLEC 将问题划分为若干分类法感知任务,即适应分类法层次路径的标签子集,并使用动态并行特征共享方法在这些任务上进行训练,其中模型的某些部分在任务之间共享,而其他部分则是特定于任务的。然后,在推理时,TAMLEC 使用文档中可用的标签来推断适当的任务并预测缺失的标签。为了实现这一结果,TAMLEC 使用了一种改进的 Transformer 架构,该架构在由任务自然诱导的弱半格结构上预测有序的标签序列。这种方法带来了多重优势。首先,我们在真实世界数据集上的实验表明,TAMLEC 在各种 XMLCo 问题上优于现有最先进的方法。其次,TAMLEC 在结构上特别适合少样本 XML 任务,在这些任务中,新任务或标签仅引入少量示例,广泛的评估凸显了其与现有方法相比的强劲性能。
引用
@article{arxiv.2412.13809,
title = {Extreme Multi-label Completion for Semantic Document Labelling with Taxonomy-Aware Parallel Learning},
author = {Julien Audiffren and Christophe Broillet and Ljiljana Dolamic and Philippe Cudré-Mauroux},
journal= {arXiv preprint arXiv:2412.13809},
year = {2024}
}