MuggleMath:评估查询与响应增强对数学推理的影响
计算与语言
2024-07-18 v3 人工智能
机器学习
摘要
在使用大语言模型 (LLMs) 进行数学推理时,通过查询演化与多样化推理路径进行微调数据增强已被经验证有效,显著缩小了开源 LLMs 与尖端专有 LLMs 之间的差距。在本文中,我们对数学推理中的此类数据增强进行了调研,旨在回答:(1) 哪些数据增强策略更有效;(2) 增强数据量与模型性能之间的缩放关系为何;以及 (3) 数据增强能否激励对分布外数学推理任务的泛化?为此,我们通过复杂化与多样化查询并从 GSM8K 和 MATH 中采样多条推理路径,创建了两个新数据集 AugGSM8K 和 AugMATH。我们通过在 AugGSM8K 和 AugMATH 上微调 LLaMA 模型,获得了一系列称为 MuggleMath 的 LLMs。MuggleMath 在 GSM8K 和 MATH 上大幅取得了新的最先进 (state-of-the-art, SOTA) 结果。分别在 GSM8K 和 MATH 上,MuggleMath 的性能与增强数据量之间呈现出对数线性关系与分段对数线性关系。我们还发现其从 AugGSM8K 到 MATH 以及从 AugMATH 到 GSM8K 的分布外数学推理泛化能力较弱,这表明增强覆盖更广学科范围的查询更利于泛化。我们在 https://github.com/OFA-Sys/gsm8k-ScRel 发布了代码与增强数据。
引用
@article{arxiv.2310.05506,
title = {MuggleMath: Assessing the Impact of Query and Response Augmentation on Math Reasoning},
author = {Chengpeng Li and Zheng Yuan and Hongyi Yuan and Guanting Dong and Keming Lu and Jiancan Wu and Chuanqi Tan and Xiang Wang and Chang Zhou},
journal= {arXiv preprint arXiv:2310.05506},
year = {2024}
}
备注
Accepted to ACL 2024 Main Conference