开放、封闭还是小型语言模型用于文本分类?
计算与语言
2023-08-22 v1 人工智能
摘要
大语言模型(LLM)近期的进展在各种 NLP 任务中展现出卓越能力。但许多问题尚存,包括开源模型是否匹敌封闭模型、这些模型为何在某些任务上表现出色或吃力,以及哪些类型的实用流程可提升性能。我们在分类背景下,通过使用八个数据集跨越三个不同任务(命名实体识别、政党预测和错误信息检测)评估三类模型来解决这些问题。虽然更大的 LLM 常带来性能提升,开源模型可通过微调媲美其闭源对手。此外,有监督的小型模型(如 RoBERTa)在许多数据集上可比生成式 LLM 取得相似甚至更优性能。另一方面,封闭模型在要求最高泛化性的困难任务上保持优势。本研究强调了基于任务需求进行模型选择的重要性。
引用
@article{arxiv.2308.10092,
title = {Open, Closed, or Small Language Models for Text Classification?},
author = {Hao Yu and Zachary Yang and Kellin Pelrine and Jean Francois Godbout and Reihaneh Rabbany},
journal= {arXiv preprint arXiv:2308.10092},
year = {2023}
}
备注
14 pages, 15 Tables, 1 Figure