中文

TeleCom-Bench:大语言模型距离工业电信应用有多远?

人工智能 2026-05-19 v1

摘要

尽管大语言模型在各个垂直场景中实现了显著的整合,但由于缺乏标准化的评估框架,它们在电信领域的部署仍处于探索阶段。当前的电信基准主要关注静态的基础知识和孤立的原子技能,忽略了现实生产系统所必需的设备特定文档和端到端工业工作流。为了弥合这一差距,我们提出了 TeleCom-Bench,这是一个包含 12 个评估集和 22,678 个精选样本的综合基准,它通过一个协同的层级结构评估 LLM:(1) 多维知识理解,通过知识图谱驱动的合成,将电信基础知识、3GPP 协议和 5G 网络架构与涵盖有线、核心和无线网络的专有产品知识相结合;(2) 端到端知识应用,将来自现网智能体工作流真实轨迹上的六项核心任务形式化,包括意图识别、实体提取、事件验证、工具调用、根因分析和方案生成——涵盖网络优化和故障维护场景。对八个最先进的 LLM 的评估揭示了一个普遍的执行墙:虽然模型在意图识别和实体提取等语言接口任务中达到了 90% 的准确率,但在方案生成等程序化执行任务中性能却骤降至约 30%。这种能力差距表明,当前的 LLM 可以胜任诊断师的角色,但无法胜任现场工程师的角色。TeleCom-Bench 提供了标准化的诊断以精确指出这一缺陷,为面向生产就绪电信智能体的特定领域对齐提供了可操作的指导。数据集和评估代码已在 https://github.com/ZTE-AICloud/TeleCom-Bench 发布。

关键词

引用

@article{arxiv.2605.18025,
  title  = {TeleCom-Bench: How Far Are Large Language Models from Industrial Telecommunication Applications?},
  author = {Jieting Xiao and Yun Lin and Huizhen Qiu and Rui Ma and Chen Zhong and Dongyang Xu and Xiao Long and Chaoyu Zhang and Qiaobo Hao and Ding Zou and Zhiguo Yang and Yanqin Gao and Fang Tan},
  journal= {arXiv preprint arXiv:2605.18025},
  year   = {2026}
}

备注

Accepted by KDD 2026