中文

电信语言模型:必须庞大吗?

计算与语言 2024-06-26 v2 机器学习

摘要

电信领域对大型语言模型 (LLM) 日益增长的兴趣凸显了其彻底革新运营效率的潜力。然而,这些复杂模型的部署往往因其庞大的规模和计算需求而受阻,引发了人们对其在资源受限环境中可行性的担忧。为应对这一挑战,近期的进展见证了小型语言模型的出现,令人惊讶的是,它们在编程和常识推理等许多任务中表现出与大型模型相当的性能。Phi-2 作为一个紧凑而强大的模型,体现了这一波高效小型语言模型的新浪潮。本文对 Phi-2 在电信领域的内在理解能力进行了全面评估。认识到与规模相关的局限性,我们通过检索增强生成 (Retrieval-Augmented Generation) 方法增强了 Phi-2 的能力,精心整合了一个专门使用电信标准规范构建的广泛知识库。增强后的 Phi-2 模型在准确性上表现出显著提升,在回答有关电信标准的问题时,其精确度与资源消耗更高的 GPT-3.5 不相上下。本文进一步探讨了 Phi-2 在解决电信领域问题场景中的精炼能力,突出了其潜力与局限性。

关键词

引用

@article{arxiv.2403.04666,
  title  = {Telecom Language Models: Must They Be Large?},
  author = {Nicola Piovesan and Antonio De Domenico and Fadhel Ayed},
  journal= {arXiv preprint arXiv:2403.04666},
  year   = {2024}
}