通过双通道思维链集成增强电信大语言模型的置信度估计
机器学习
2026-04-16 v1
摘要
大语言模型(LLMs)正越来越多地应用于复杂的电信任务,包括 3GPP 规范分析和 O-RAN 网络故障排除。然而,一个关键的局限性仍然存在:LLM 生成的置信度分数通常存在偏差且不可靠,经常表现出系统性的过度自信。这种缺乏可信的自我评估使得在实践中难以验证模型输出并安全地依赖它们。在本文中,我们使用代表性的 Gemma-3 模型系列(4B、12B 和 27B 参数),在 TeleQnA、ORANBench 和 srsRANBench 上评估了电信领域 LLM 的置信度校准。我们表明,标准的单通道、口头化置信度估计未能反映真实的正确性,经常将高置信度分配给错误的预测。为了解决这个问题,我们提出了一种新颖的双通道思维链(CoT)集成方法,通过利用多个独立的推理评估并将其评估聚合为校准的置信度分数,来改进置信度估计。我们的方法在基准测试中将期望校准误差(ECE)降低了高达 88%,显著提高了模型自我评估的可靠性。这些结果凸显了当前置信度估计实践的局限性,并展示了在电信领域实现更可信的 LLM 输出评估的实用路径。
引用
@article{arxiv.2604.13271,
title = {Enhancing Confidence Estimation in Telco LLMs via Twin-Pass CoT-Ensembling},
author = {Anton Saenko and Pranshav Gajjar and Abiodun Ganiyu and Vijay K. Shah},
journal= {arXiv preprint arXiv:2604.13271},
year = {2026}
}