中文

ORAN-Bench-13K:用于评估开放无线接入网络中大型语言模型的开源基准

网络与互联网体系结构 2024-07-16 v2 人工智能 计算与语言 机器学习

摘要

大型语言模型 (LLM) 可以通过增强网络分析、异常检测和代码生成,并显著提高大量 O-RAN 任务的效率和可靠性,从而彻底改变我们部署和运营开放无线接入网络 (O-RAN) 的方式。在本文中,我们介绍了 ORAN-Bench-13K,这是第一个旨在评估大型语言模型 (LLM) 在 O-RAN 背景下性能的综合性基准。我们的基准测试包含从 116 份 O-RAN 规范文档中精心筛选出的 13,952 道多项选择题。我们利用一个新颖的三阶段 LLM 框架,并将问题分为三个不同的难度级别,以涵盖广泛的 O-RAN 相关知识。我们彻底评估了几个最先进的 LLM 的性能,包括 Gemini、Chat-GPT 和 Mistral。此外,我们提出了 ORANSight,一个基于检索增强生成 (RAG) 的流水线,它在 ORAN-Bench-13K 上表现出优于其他测试的闭源模型的性能。我们的研究结果表明,当前流行的 LLM 模型在 O-RAN 方面并不精通,这凸显了对专门模型的需求。我们观察到,在引入基于 RAG 的 ORANSight 流水线后,性能有了显著提升,其宏观准确率为 0.784,加权准确率为 0.776,平均比其他测试的 LLM 分别高出 21.55% 和 22.59%。

关键词

引用

@article{arxiv.2407.06245,
  title  = {ORAN-Bench-13K: An Open Source Benchmark for Assessing LLMs in Open Radio Access Networks},
  author = {Pranshav Gajjar and Vijay K. Shah},
  journal= {arXiv preprint arXiv:2407.06245},
  year   = {2024}
}