中文

TelcoAgent-Bench:面向电信AI代理的多语言基准测试

计算与语言 2026-04-09 v1

摘要

将大语言模型(LLM)智能体集成到电信网络中引入了新的挑战,涉及意图识别、工具执行和解决方案生成,同时需要考虑不同的运营约束。在本文中,我们提出TelcoAgent-Bench和TelcoAgent-Metrics,一个面向评估多语言电信LLM智能体的电信特定基准测试框架。该提议的框架评估语义理解以及与结构化故障排查流程的过程级对齐,以及在重复场景变化中的稳定性。我们的贡献包括一套结构化的指标,用于评估意图识别、有序工具执行、解决方案正确性以及场景变化中的稳定性,旨在量化LLM智能体在电信环境中的可靠性和运营一致性。该框架设计为在英语和阿拉伯语两种语言下运行,以满足运营网络环境中多语言智能体部署的需求。我们的实验结果表明,尽管近期的指令微调模型能够以合理的方式理解电信问题,但它们通常难以一致地遵循所需的故障排查步骤,并且在暴露于同一场景的不同变化时难以保持稳定的行为表现。这一性能差距在无约束和双语设置中更为明显。

关键词

引用

@article{arxiv.2604.06209,
  title  = {TelcoAgent-Bench: A Multilingual Benchmark for Telecom AI Agents},
  author = {Lina Bariah and Brahim Mefgouda and Farbod Tavakkoli and Enrique Molero and Louis Powell and Merouane Debbah},
  journal= {arXiv preprint arXiv:2604.06209},
  year   = {2026}
}