中文

TSpec-LLM: 用于 LLM 理解 3GPP 规范的开源数据集

网络与互联网体系结构 2024-06-07 v1 信息论 信号处理 math.IT

摘要

理解电信标准涉及梳理大量技术文档,例如第三代合作伙伴计划(3rd Generation Partnership Project, 3GPP)产生的文档,这一过程既耗时又费力。虽然大型语言模型(Large Language Models, LLM)可以协助处理广泛的 3GPP 知识库,但一个全面的数据集对于其有效的预训练和微调至关重要。在本文中,我们介绍了 TSpec-LLM,这是一个开源的综合数据集,涵盖了从 Release 8 到 Release 19(1999--2023)的所有 3GPP 文档。为了评估其有效性,我们首先选择了 3GPP 文档的代表性样本,创建了相应的技术问题,并评估了各种 LLM 的基线性能。然后,我们引入了检索增强生成(Retrieval-Augmented Generation, RAG)框架,通过从 TSpec-LLM 数据集中检索相关上下文来增强 LLM 的能力。我们的评估表明,在 TSpec-LLM 上使用朴素 RAG 框架将 GPT-3.5、Gemini 1.0 Pro 和 GPT-4 的准确率分别从 44%、46% 和 51% 提升至 71%、75% 和 72%。

关键词

引用

@article{arxiv.2406.01768,
  title  = {TSpec-LLM: An Open-source Dataset for LLM Understanding of 3GPP Specifications},
  author = {Rasoul Nikbakht and Mohamed Benzaghta and Giovanni Geraci},
  journal= {arXiv preprint arXiv:2406.01768},
  year   = {2024}
}