TeleQnA:用于评估大语言模型电信知识的基准数据集
信息论
2023-10-24 v1 人工智能
机器学习
math.IT
摘要
我们介绍了 TeleQnA,这是首个旨在评估大语言模型(LLMs)在电信领域知识的基准数据集。该数据集包含 10,000 道问答,来源于标准文档和研究论文等多种来源。本文概述了负责生成该数据集的自动化问题生成框架,以及在各阶段如何引入人工输入以确保问题质量。随后,利用所提供的数据集,对包括 GPT-3.5 和 GPT-4 在内的 LLMs 能力进行了评估。结果表明,这些模型在处理与复杂标准相关的问题时表现吃力,但在应对通用电信相关询问时展现出熟练度。此外,我们的结果展示了引入电信知识上下文如何显著提升其性能,从而揭示了对专用电信基础模型的需求。最后,该数据集与活跃的电信专业人员共享,其表现随后与 LLMs 进行了基准对比。研究结果表明,得益于处理海量信息的能力,LLMs 在电信知识方面可媲美活跃专业人员的表现,凸显了 LLMs 在该领域的潜力。该数据集已在 GitHub 上公开。
引用
@article{arxiv.2310.15051,
title = {TeleQnA: A Benchmark Dataset to Assess Large Language Models Telecommunications Knowledge},
author = {Ali Maatouk and Fadhel Ayed and Nicola Piovesan and Antonio De Domenico and Merouane Debbah and Zhi-Quan Luo},
journal= {arXiv preprint arXiv:2310.15051},
year = {2023}
}