TeleResilienceBench:量化电信领域 LLM 推理的韧性
机器学习
2026-05-12 v1 软件工程
摘要
在电信领域部署大语言模型需要的不仅仅是任务准确性。在现实工作流中,模型可能会继承来自前一步骤、上游智能体或其自身早期生成的部分已完成推理,并且即使该推理已经出错,也必须继续该推理。我们引入了 TeleResilienceBench,这是一个量化此能力的基准,我们称之为推理韧性,涵盖了来自 GSMA Open-Telco LLM 套件的七个电信子领域。实例的构建方法是:从一个弱生成器模型中收集失败样本,将有缺陷的推理轨迹在其中间截断,并要求目标模型继续并纠正它。我们提出 Correct Flip Rate (CFR) 作为成功恢复的直接度量,并评估了涵盖 Qwen3.5、Gemma4 和 Nemotron-3 家族的八个模型。我们的结果表明,即使是最强的模型也仅达到 29.1\% 的宏观平均 CFR,并且在同系列模型中规模扩大并不能可靠地提升韧性。Nemotron-3-nano 4b 优于包括 27b 模型在内的所有 Qwen3.5 变体,并在辅助的 TeleMath 数值评估中以 23.4\% 的 CR% 领先,提供了该系列中最佳的韧性与成本比。难度分层分析进一步揭示,现有的电信基准难度标签反映的是事实特异性而非推理深度,表明当前的评估更多衡量的是知识覆盖度而非推理能力。
引用
@article{arxiv.2605.09929,
title = {TeleResilienceBench: Quantifying Resilience for LLM Reasoning in Telecommunications},
author = {Pranshav Gajjar and Emmanuel Ojo and Vijay K Shah},
journal= {arXiv preprint arXiv:2605.09929},
year = {2026}
}