关键点驱动的数据合成及其在数学推理中的增强
计算与语言
2024-05-09 v3 人工智能
摘要
大型语言模型(LLM)在复杂推理任务中展现出巨大潜力,但其性能往往受限于高质量且专注于推理的训练数据集的稀缺。针对这一挑战,我们提出了关键点驱动的数据合成(Key-Point-Driven Data Synthesis, KPDDS),这是一种新颖的数据合成框架,通过利用来自真实数据源的关键点和示例实践来合成问答对。KPDDS 确保了生成的新问题具有严格的质量控制和显著的可扩展性。因此,我们推出了 KPMath,这是一个专为数学推理定制的广泛合成数据集,包含超过 80 万对问答对。利用 KPMath 并辅以额外的推理密集型语料库,我们构建了综合数据集 KPMath-Plus。在 KPMath-Plus 上微调的 Qwen1.5-72B 模型在 GSM8K 上达到了 87.0% 的 PASS@1 准确率,在 MATH 上达到了 58.3%,超越了 7B 至 70B 参数范围内的竞争对手以及 GPT-4 等最佳商业模型在多个数学推理数据集上的表现。
引用
@article{arxiv.2403.02333,
title = {Key-Point-Driven Data Synthesis with its Enhancement on Mathematical Reasoning},
author = {Yiming Huang and Xiao Liu and Yeyun Gong and Zhibin Gou and Yelong Shen and Nan Duan and Weizhu Chen},
journal= {arXiv preprint arXiv:2403.02333},
year = {2024}
}
备注
In progress