中文

通过大型语言模型微调推进单任务与多任务文本分类

计算与语言 2025-05-13 v2 人工智能

摘要

编码器模型(如 BERT、RoBERTa)和大型语言模型(LLM,如 Llama3)广泛用于文本分类任务。然而,缺乏对编码器模型和 LLM 在文本分类中性能的系统性比较,尤其是在涉及微调的情况下。本研究采用多样化的模型和方法,规模和架构各异,包括微调和预训练方法。我们首先评估了这些 LLM 在 20 Newsgroups(20NG)和 MASSIVE 数据集上的性能,并将其与编码器-only RoBERTa 模型进行比较。此外,我们通过将多个分类任务(包括意图检测和槽填充)组合到单个模型中,使用来自两个数据集的数据,探索了两种模型类型的多任务能力。我们的结果表明,完全微调的 Llama3-70B 模型在各种分类任务和数据集上超越了 RoBERTa-large 和其他解码器 LLM。此外,合并的多任务微调 LLM 在两个数据集上的两个任务中,性能与双模型设置相当。总体而言,我们的研究为编码器-only 和 LLM 模型在文本分类任务上的综合基准测试提供了全面分析,并展示了一种将两个或多个完全微调的解码器 LLM 组合以降低延迟和等效性能的方法。

关键词

引用

@article{arxiv.2412.08587,
  title  = {Advancing Single and Multi-task Text Classification through Large Language Model Fine-tuning},
  author = {Hang Zhao and Qile P. Chen and Yijing Barry Zhang and Gang Yang},
  journal= {arXiv preprint arXiv:2412.08587},
  year   = {2025}
}

备注

9 pages, 3 tables