用于工业数据的多标签分类的语言模型
软件工程
2025-04-24 v2
摘要
多标签需求分类是一项具有挑战性的任务,尤其是当面对大量不同抽象层次的类别时。当可用于训练监督分类器的需求数量有限时,这种挑战性更加明显。零样本学习(ZSL)无需训练数据,可能能够解决此问题。本文探讨了在多标签工业数据集上对零样本分类器(ZSC)的性能。我们专注于根据旨在支持需求追踪的分类学对需求进行分类。我们比较了使用不同嵌入方式的多种ZSC变体,包括9种参数规模较小的语言模型(最高至30亿参数,如BERT),以及5种参数规模巨大的大语言模型(LLMs,最高至70亿参数,如Llama)。我们的真实数据包括377条需求和1968个标签,来自6个输出空间。对于评估,我们采用传统指标(精确率、召回率、F1值及),以及一种新颖的标签距离度量Dn。这一度量旨在更好地捕捉分类的层次性质,为评估结果与真实值之间的距离提供更细致的分析。1)在5个输出空间中表现最好的模型是T5-xl,最高=0.78,Dn=0.04;而BERT base在一个案例中表现最佳,最高=0.83,Dn=0.04。2)参数规模较小的语言模型(LMs)在分类任务中表现优于大语言模型(LLMs)。因此,实际应用中可行,因为所需计算资源有限。3)模型架构(自编码、自回归和句子到句子)显著影响分类器的性能。我们得出结论,使用ZSL进行多标签需求分类可带来有前景的效果。我们还提出了一种可用于选择该问题最佳模型的新指标。
引用
@article{arxiv.2504.15922,
title = {Language Models to Support Multi-Label Classification of Industrial Data},
author = {Waleed Abdeen and Michael Unterkalmsteiner and Krzysztof Wnuk and Alessio Ferrari and Panagiota Chatzipetrou},
journal= {arXiv preprint arXiv:2504.15922},
year = {2025}
}
备注
Accepted at SANER Conference 2025. Awaiting publication by IEEE