对齐中的数据多样化方法提升 LLM 的数学性能
人工智能
2025-07-04 v1
摘要
尽管偏好学习的最新进展增强了人类反馈中的对齐,但数学推理仍然是一个持续的挑战。我们研究了偏好优化中的数据多样化策略如何提升大型语言模型(LLMs)的数学推理能力。我们评估了三种常见的数据生成方法:温度采样、思维链提示和蒙特卡洛树搜索(MCTS),并引入了 Diversified-ThinkSolve(DTS),这是一种新颖的结构化方法,可将问题系统地分解为多样化的推理路径。我们的结果表明,通过策略性地多样化偏好数据,模型可以大幅提升数学推理性能,其中最佳方法在 GSM8K 上比基础模型提升了 7.1%,在 MATH 上提升了 4.2%。尽管性能强劲,但与基线相比,DTS 仅产生微小的计算开销(1.03 倍),而 MCTS 的成本高出近五倍且收益更低。这些发现表明,对多样化问题解决方法的结构化探索,比传统方法能为数学对齐创建更有效的偏好数据。
引用
@article{arxiv.2507.02173,
title = {Data Diversification Methods In Alignment Enhance Math Performance In LLMs},
author = {Berkan Dokmeci and Qingyang Wu and Ben Athiwaratkun and Ce Zhang and Shuaiwen Leon Song and James Zou},
journal= {arXiv preprint arXiv:2507.02173},
year = {2025}
}