中文

M2A:在大语言模型中协同数学与智能体推理

人工智能 2026-05-12 v1

摘要

尽管推理已成为大语言模型的核心能力,但不同场景所需的推理模式往往不一致。数学推理通常依赖内在逻辑在单次响应中解决封闭世界问题,而智能体推理不仅需要内部推理,还需要与外部环境进行多轮交互,交替进行思考与行动。这种不一致使得数学推理与智能体推理无法有效相互促进,常导致不稳定的推理行为,且在多任务学习下仅带来有限的性能提升。在本文中,我们提出了 M2A,一种通过模型合并来协同数学与智能体推理的新范式。为避免在联合训练中对表面推理模式的过拟合,M2A 直接在参数空间中操作:它识别对智能体行为至关重要的特征子空间,并仅沿其零空间合并数学推理任务向量,从而在不干扰智能体行为的方向上注入推理能力。与 SFT 或 RL 不同,M2A 无需额外的梯度更新,并将合并系数暴露为一个用于控制推理长度的简单旋钮。在具有挑战性的真实世界编程智能体环境下的实验表明,我们的方法有效延长了智能体推理深度并带来了显著的性能提升。应用于微调后的 Qwen3-8B,M2A 在无需重新训练模型的情况下,将其在 SWE-Bench Verified 上的解决率从 44.0% 提升至 51.2%。代码可在 https://github.com/laplucky/M2A.git 获取。

关键词

引用

@article{arxiv.2605.09879,
  title  = {M2A: Synergizing Mathematical and Agentic Reasoning in Large Language Models},
  author = {Junjian Wang and Xin Zhou and Qiran Xu and Kun Zhan},
  journal= {arXiv preprint arXiv:2605.09879},
  year   = {2026}
}