中文

TeleTables:面向电信业表格解读的大语言模型基准

计算与语言 2026-01-09 v1 人工智能 机器学习

摘要

大语言模型 (LLM) 正在越来越多地被用于电信行业,以支持工程任务、加快故障排查,并帮助解读复杂技术文件。然而,近期研究表明,LLM 在电信标准方面表现不佳,尤其是 3GPP 规范。我们认为,关键原因在于这些标准密集地包含大量表格来呈现关键信息,而 LLM 对此类表格的知识和解读能力尚未得到充分考察。为填补这一空白,我们引入 TeleTables,一个用于评估大语言模型在技术规范中表格解读能力的基准测试。TeleTables 通过一种新颖的多阶段数据生成管道构建,从 3GPP 规范中提取表格,并利用多模态和以推理为导向的 LLM 生成和验证问题。最终得到的数据集已公开,包含 500 组人工验证的问答对,每组都对应多种格式的表格。我们的评估显示,参数规模较小的模型(小于 100 亿参数)在记忆 3GPP 知识和解读表格方面都表现不佳,这表明其预训练期间对电信标准的暴露有限,且缺乏处理复杂技术材料的归纳偏置。相对的,大模型在表格解读方面表现出更强的推理能力。总体而言,TeleTables 凸显了针对电信标准进行领域专用微调的必要性,以可靠地解读和推理。

关键词

引用

@article{arxiv.2601.04202,
  title  = {TeleTables: A Benchmark for Large Language Models in Telecom Table Interpretation},
  author = {Anas Ezzakri and Nicola Piovesan and Mohamed Sana and Antonio De Domenico and Fadhel Ayed and Haozhe Zhang},
  journal= {arXiv preprint arXiv:2601.04202},
  year   = {2026}
}