中文

6G-Bench:面向AI原生6G网络的语义通信与网络级推理开放基准

网络与互联网体系结构 2026-02-10 v1 人工智能

摘要

本文介绍6G-Bench,一个用于评估AI原生6G网络中语义通信和网络级推理的开放基准。6G-Bench从3GPP、IETF、ETSI、ITU-T和O-RAN联盟等组织中的6G和AI代理标准化活动中提取出30个决策任务(T1--T30),并将其组织为五个标准化对齐的能力类别。从113,475个场景出发,我们生成一套平衡的10,000个非常困难的多选题,使用任务条件化提示确保在不确定性下进行多步骤定量推理,并在多回合时段下最小化最坏后悔。经过自动过滤和专家人类验证后,保留下3,722个作为高置信度评估集,而完整数据集将公开以支持训练和微调6G专用模型。使用6G-Bench,我们评估了22个基础模型,包括稠密和Mixture-of-Experts架构、短时序和长时序设计(最高达1M token),以及开源权重和专有系统。所有模型中,确定性单次准确率(pass@1)范围广泛,从0.22到0.82,突显了语义推理能力的显著差异。领先模型在意图和政策推理准确率达到0.87--0.89,而对推理密集型任务的选择性鲁棒性分析显示pass@5值范围从0.20到0.91。为支持开放科学和可重复性,我们将6G-Bench数据集发布在GitHub上:https://github.com/maferrag/6G-Bench

关键词

引用

@article{arxiv.2602.08675,
  title  = {6G-Bench: An Open Benchmark for Semantic Communication and Network-Level Reasoning with Foundation Models in AI-Native 6G Networks},
  author = {Mohamed Amine Ferrag and Abderrahmane Lakas and Merouane Debbah},
  journal= {arXiv preprint arXiv:2602.08675},
  year   = {2026}
}