中文

WirelessMathLM:基于强化学习为 LLMs 教学无线通信中的数学推理

机器学习 2025-09-30 v1

摘要

大型语言模型(LLM)在通用数学推理方面表现出色,但在专门的数学问题上会出现灾难性失败。在无线通信领域,问题需要精确地操作信息论界限、优化约束和信号处理公式,即使是最先进的模型也难以达到 competent 性能。我们提出了 WirelessMathLM,展示了紧凑型模型(0.5B-7B 参数)可以通过领域特定的强化学习与可验证奖励来匹配或超越更大的模型。我们的关键洞察是,无线数学问题具有唯一的属性——可验证的正确性——这使得在没有人类反馈的情况下仍能有效进行强化学习。我们构建了 WirelessMathBench-XL,这是一个来自 970 篇论文的综合性基准,包含 4027 个问题。使用带二进制验证奖励的 Group Relative Policy Optimization(GRPO),我们直接从基础检查点训练模型,无需监督式预热。我们的 7B 模型在 WirelessMathBench-XL 上的准确率达到 39.5%,接近 GPT-4o(40.4%),而仅使用约 DeepSeek-R1(671B,57.4%)的 1% 参数。值得注意的是,GRPO 训练几乎在所有模型规模上都 nearly 翻倍了性能提升(0.5B +11%,3B +103%,7B +81%),且对通用数学基准测试也具有正向迁移——我们的模型在 MATH、Minerva-Math、OlympiadBench、AMC 和 AIME 上平均提升 8.4 分,尽管这些任务上没有进行训练。

关键词

引用

@article{arxiv.2509.23219,
  title  = {WirelessMathLM: Teaching Mathematical Reasoning for LLMs in Wireless Communications with Reinforcement Learning},
  author = {Xin Li and Mengbing Liu and Yiyang Zhu and Wenhe Zhang and Li Wei and Jiancheng An and Chau Yuen},
  journal= {arXiv preprint arXiv:2509.23219},
  year   = {2025}
}

备注

Project Homepage: https://lixin.ai/WirelessMathLM