通过大型语言模型微调推进单任务与多任务文本分类
计算与语言
2025-05-13 v2 人工智能
摘要
编码器模型(如 BERT、RoBERTa)和大型语言模型(LLM,如 Llama3)广泛用于文本分类任务。然而,缺乏对编码器模型和 LLM 在文本分类中性能的系统性比较,尤其是在涉及微调的情况下。本研究采用多样化的模型和方法,规模和架构各异,包括微调和预训练方法。我们首先评估了这些 LLM 在 20 Newsgroups(20NG)和 MASSIVE 数据集上的性能,并将其与编码器-only RoBERTa 模型进行比较。此外,我们通过将多个分类任务(包括意图检测和槽填充)组合到单个模型中,使用来自两个数据集的数据,探索了两种模型类型的多任务能力。我们的结果表明,完全微调的 Llama3-70B 模型在各种分类任务和数据集上超越了 RoBERTa-large 和其他解码器 LLM。此外,合并的多任务微调 LLM 在两个数据集上的两个任务中,性能与双模型设置相当。总体而言,我们的研究为编码器-only 和 LLM 模型在文本分类任务上的综合基准测试提供了全面分析,并展示了一种将两个或多个完全微调的解码器 LLM 组合以降低延迟和等效性能的方法。
引用
@article{arxiv.2412.08587,
title = {Advancing Single and Multi-task Text Classification through Large Language Model Fine-tuning},
author = {Hang Zhao and Qile P. Chen and Yijing Barry Zhang and Gang Yang},
journal= {arXiv preprint arXiv:2412.08587},
year = {2025}
}
备注
9 pages, 3 tables