中文

大型语言模型能否在工业规模下有效用于层次化多标签科学文档分类?

人工智能 2024-12-09 v1

摘要

我们聚焦于科学文档的层次化多标签分类(HMC)任务,面向工业规模场景,即需在数十万篇文档上跨数千个动态标签进行分类。随着科学文献的快速增长,亟需具备可扩展性和效率的分类方法,而动态分类体系的演变(引入新类别、合并既有类别、淘汰过时类别)进一步增加了复杂性。传统机器学习方法需要在每次分类体系更新后重新训练,因标注数据收集和模型适应的高开销而难以实践。大型语言模型(LLM)在复杂任务(如多标签分类)中展现出巨大潜力,但将其应用于大规模动态分类体系面临独特挑战——标签数量庞大可能超出LLM的输入限制。本文提出新方法,融合LLM优势与稠密检索技术,以克服上述挑战。我们的方案通过零样本HMC实现实时标签分配,无需重新训练。我们在SSRAN(一个跨学科预印本库)上评估了方法有效性,结果在分类准确率和成本效益方面均实现显著提升。我们构建了针对动态分类体系的量身定制评估框架,并公开代码,为在工业规模文档分类中应用LLM(即类别数量等于大型分类体系节点数)提供了关键性洞见。

关键词

引用

@article{arxiv.2412.05137,
  title  = {Can Large Language Models Serve as Effective Classifiers for Hierarchical Multi-Label Classification of Scientific Documents at Industrial Scale?},
  author = {Seyed Amin Tabatabaei and Sarah Fancher and Michael Parsons and Arian Askari},
  journal= {arXiv preprint arXiv:2412.05137},
  year   = {2024}
}

备注

This paper has been accepted at COLING 2025 (Industry Track)