小巨人:较小的大型语言模型能否在现实世界的会议摘要中发挥超常作用?
计算与语言
2024-04-16 v2
摘要
大型语言模型(LLMs)在无需针对特定任务数据集进行显式微调的情况下,已展现出解决广泛任务的惊人能力。然而,在现实世界中部署LLMs并非易事,因为它需要大量的计算资源。本文研究较小的紧凑型LLMs是否可以作为相对较大的LLMs的良好替代方案,以解决在现实世界中使用LLMs所带来的显著成本。为此,我们在真实的工业环境中研究会议摘要任务,并通过比较微调后的紧凑型LLMs(如FLAN-T5、TinyLLaMA、LiteLLaMA)与零样本大型LLMs(如LLaMA-2、GPT-3.5、PaLM-2)的性能,进行了大量实验。我们观察到,大多数较小的LLMs,即使经过微调,在会议摘要数据集上也未能超越较大的零样本LLMs。然而,一个显著的例外是FLAN-T5(780M参数),其性能与许多零样本大型LLMs(从7B到超过70B参数)相当甚至更好,同时体积显著更小。这使得像FLAN-T5这样的紧凑型LLMs成为现实世界工业部署中具有成本效益的合适解决方案。
引用
@article{arxiv.2402.00841,
title = {Tiny Titans: Can Smaller Large Language Models Punch Above Their Weight in the Real World for Meeting Summarization?},
author = {Xue-Yong Fu and Md Tahmid Rahman Laskar and Elena Khasanova and Cheng Chen and Shashi Bhushan TN},
journal= {arXiv preprint arXiv:2402.00841},
year = {2024}
}
备注
Accepted by NAACL 2024 (Industry Track). The first two authors contributed equally to this work