中文

WirelessMathBench:面向LLM在无线通信中的数学建模基准

计算与语言 2025-05-21 v1 机器学习

摘要

大型语言模型(LLM)在广泛的任务中取得了令人瞩目的成绩,但其在复杂、领域特定数学推理方面的能力——尤其是在无线通信领域——仍未得到充分探索。本文引入WirelessMathBench,一个专为评估LLM在无线通信工程中数学建模挑战而设计的新型基准测试。该基准由587个经精心挑选的题目构成,来源于40篇最新前沿研究论文,涵盖从基础多选题到复杂方程补全任务的多样化任务类型,包括部分补全和完全补全,所有题目均严格遵循物理和维度约束。通过对领先LLM进行大规模实验,我们观察到许多模型在基础记忆任务中表现优异,但在重构部分或完全遮蔽方程时性能显著下降,暴露了当前LLM的根本局限。即便是在本基准测试中表现最佳的DeepSeek-R1,其平均准确率仅为38.05%,在完全方程补全中仅达7.83%。我们公开发布WirelessMathBench及其评估工具包,旨在推动开发更稳健、更具领域感知力的LLM,以适用于无线系统分析及更广泛的工程应用。

关键词

引用

@article{arxiv.2505.14354,
  title  = {WirelessMathBench: A Mathematical Modeling Benchmark for LLMs in Wireless Communications},
  author = {Xin Li and Mengbing Liu and Li Wei and Jiancheng An and Mérouane Debbah and Chau Yuen},
  journal= {arXiv preprint arXiv:2505.14354},
  year   = {2025}
}

备注

Accepted to ACL 2025 Findings