TeleEval-OS:面向运营调度的大型语言模型性能评估
计算与语言
2025-06-16 v1 人工智能
性能
摘要
大型语言模型(LLMs)的快速发展显著推动了人工智能的进步,在多个专业领域展现出巨大的应用潜力。电信运营调度(OS)是电信行业的一个关键环节,涉及对网络、服务、风险和人力资源的协调管理,以优化生产调度并确保统一的服务控制。然而,OS 任务固有的复杂性和领域特定性,加之缺乏全面的评估基准,阻碍了对 LLMs 在这一关键领域应用潜力的深入探索。为了填补这一研究空白,我们提出了首个电信运营调度评估基准(TeleEval-OS)。具体而言,该基准包含跨 13 个子任务的 15 个数据集,全面模拟了四个关键运营阶段:智能工单创建、智能工单处理、智能工单结单和智能评估。为了系统地评估 LLMs 在不同复杂度任务上的性能,我们将其在电信运营调度中的能力划分为四个层级,按难度递增排列:基础 NLP、知识问答、报告生成和报告分析。在 TeleEval-OS 上,我们利用零样本和少样本评估方法,在多种场景下全面评估了 10 个开源 LLMs(如 DeepSeek-V3)和 4 个闭源 LLMs(如 GPT-4o)。实验结果表明,开源 LLMs 在特定场景下可以优于闭源 LLMs,突显了它们在电信运营调度领域的巨大潜力和价值。
关键词
引用
@article{arxiv.2506.11017,
title = {TeleEval-OS: Performance evaluations of large language models for operations scheduling},
author = {Yanyan Wang and Yingying Wang and Junli Liang and Yin Xu and Yunlong Liu and Yiming Xu and Zhengwang Jiang and Zhehe Li and Fei Li and Long Zhao and Kuang Xu and Qi Song and Xiangyang Li},
journal= {arXiv preprint arXiv:2506.11017},
year = {2025}
}