中文

面向多类别科学文献多标签分类的高效少样本学习

计算与语言 2024-10-22 v3

摘要

科学文献分类是一项关键任务,通常涉及许多类别。然而,为众多类别收集人工标注数据成本高昂,且常导致标签稀缺的情况。此外,近期工作表明,针对少样本分类的句子嵌入模型微调是高效、鲁棒且有效的。在本工作中,我们提出了FusionSent(基于融合的句子嵌入微调),一种高效且无需提示的方法,用于处理具有许多类别的科学文献的少样本分类。FusionSent利用可用的训练样本及其各自的标签文本,对比性地微调两个不同的句子嵌入模型。之后,两个微调模型的参数被融合,将来自不同微调步骤的互补知识合并到一个单一模型中。最后,得到的句子嵌入模型被冻结以嵌入训练实例,这些实例随后被用作输入特征来训练一个分类头。我们的实验表明,在多个科学文献分类数据集上,FusionSent平均比强基线高出6.0个F1分数点。此外,我们引入了一个新的科学文献多标签分类数据集,该数据集包含来自arXiv类别分类法的203,961篇科学文章和130个类别。代码和数据可在https://github.com/sebischair/FusionSent获取。

关键词

引用

@article{arxiv.2410.05770,
  title  = {Efficient Few-shot Learning for Multi-label Classification of Scientific Documents with Many Classes},
  author = {Tim Schopf and Alexander Blatzheim and Nektarios Machner and Florian Matthes},
  journal= {arXiv preprint arXiv:2410.05770},
  year   = {2024}
}

备注

Accepted to the 7th International Conference on Natural Language and Speech Processing (ICNLSP 2024)