面向电信领域的大语言模型语言智能
计算与语言
2024-02-27 v1
摘要
大语言模型(LLM)已成为自然语言处理(NLP)领域的一项重大进展,在语言生成及其他以语言为中心的任务中展现出卓越能力。尽管已在多个科学领域的众多分析和推理任务中进行了评估,但在电信领域自然语言任务方面,对其知识和理解能力的全面探索仍有待开展。因此,本研究旨在评估LLM在该领域的知识和理解能力。为此,我们对四个著名的LLM——Llama-2、Falcon、Mistral和Zephyr——进行了全面的零样本评估。这些模型相比ChatGPT需要更少的资源,因此适用于资源受限环境。其性能与当前最先进的微调模型进行了比较。据我们所知,这是首次在该领域对LLM在多个以语言为中心的任务上的理解能力进行广泛评估和比较。我们的评估表明,零样本LLM可以达到与当前最先进微调模型相当的性能水平。这表明,即使在电信领域,在大量文本语料上的预训练也使LLM具备了一定程度的专业化能力。我们还观察到,没有哪个LLM能持续优于其他模型,不同LLM的性能可能波动。尽管其性能落后于微调模型,但我们的发现强调了LLM作为理解该领域缺乏大规模标注数据的各个方面的一种宝贵资源的潜力。
引用
@article{arxiv.2402.15818,
title = {Linguistic Intelligence in Large Language Models for Telecommunications},
author = {Tasnim Ahmed and Nicola Piovesan and Antonio De Domenico and Salimur Choudhury},
journal= {arXiv preprint arXiv:2402.15818},
year = {2024}
}