中文

面向数学推理的开源大语言模型系统优化

机器学习 2025-09-10 v1 人工智能

摘要

本文通过实验多种配置(包括随机性控制、推理深度和采样策略),对数学推理任务的模型微调参数进行了实践性研究,精细调优在效率和性能上均展现出显著提升。针对五个最先进的模型在数学推理任务上引入了一个整体优化框架,在保持解答正确性的同时,表现出显著的性能提升。通过对 Qwen2.5-72B、Llama-3.1-70B、DeepSeek-V3、Mixtral-8x22B 和 Yi-Lightning 的系统性参数优化,展示了持续的效率增益,优化成功率达 100%。该方法在所有测试模型中平均降低了 29.4% 的计算成本,并提升了 23.9% 的推理速度。该框架系统地搜索参数空间,包括温度 (0.1-0.5)、推理步数 (4-12)、规划周期 (1-4) 和核采样 (0.85-0.98),通过在数学推理基准上的测试确定最优配置。关键发现表明,较低的温度区间 (0.1-0.4) 和减少的推理步数 (4-6) 能持续提升效率而不损害准确性。DeepSeek-V3 达到最高准确率 98%,而 Mixtral-8x22B 以每个准确响应 361.5 个 token 提供了最具成本效益的性能。主要贡献包括:(1) 首次对数学推理中五个不同的 SOTA 模型进行全面的优化研究,(2) 一个标准化的面向生产的参数优化框架,(3) 发现了适用于不同模型架构的通用优化趋势,以及 (4) 具有广泛性能特征描述的生产就绪配置。

关键词

引用

@article{arxiv.2509.07238,
  title  = {Systematic Optimization of Open Source Large Language Models for Mathematical Reasoning},
  author = {Pranav Pawar and Dhwaj Jain and Varun Gupta and Kaustav Dedhia and Dashrath Kale and Sudhir Dhekane},
  journal= {arXiv preprint arXiv:2509.07238},
  year   = {2025}
}