MIND:面向预训练大语言模型的数学信息合成对话
人工智能
2025-04-28 v2 计算与语言
摘要
合成数据以提升预训练数据质量从而提高下游任务准确性的做法近期已被广泛探索,但这些方法在复杂的多跳推理和数学推理任务中表现不足,因为合成数据通常未为现有语料库添加补充知识。本文提出一种新型大规模且多样化的数学信息驱动合成对话 (MIND) 生成方法,以提升大语言模型的数学推理能力。具体而言,我们使用 MIND 生成基于 OpenWebMath (OWM) 的合成对话,构建新的数学语料库 MIND-OWM。我们的实验在不同的对话设置下揭示,了解对话参与者之间的知识差距对于生成高质量数学数据至关重要。我们进一步识别了一种有效的格式化和集成合成数据与原始数据的方法,以最大化数学推理收益,强调需要重新结构化原始数据而非直接使用。与仅在原始数据上预训练的模型相比,基于 MIND-OWM 预训练的模型在数学推理方面显著提升(GSM8K:+13.42%,MATH:+2.30%),包括在专业知识(MMLU:+4.55%,MMLU-STEM:+4.28%)和通用推理任务(GENERAL REASONING:+2.51%)方面的优异性能。
引用
@article{arxiv.2410.12881,
title = {MIND: Math Informed syNthetic Dialogues for Pretraining LLMs},
author = {Syeda Nahida Akter and Shrimai Prabhumoye and John Kamalu and Sanjeev Satheesh and Eric Nyberg and Mostofa Patwary and Mohammad Shoeybi and Bryan Catanzaro},
journal= {arXiv preprint arXiv:2410.12881},
year = {2025}
}
备注
31 pages, 5 figures, 14 tables