通过丰富指令调优实现系统-2数学推理
人工智能
2024-12-25 v2 计算与语言
摘要
通过系统-2推理解决复杂数学问题是人类天然的技能,但仍是当前大型语言模型(LLM)面临的重大挑战。我们识别出刻意的多步骤推理数据稀缺性作为主要限制因素。为此,我们引入丰富指令调优(EIT),该方法通过协同人类和AI反馈丰富现有人工标注的数学数据集,以创建细粒度的推理轨迹。然后使用这些数据集对开源LLM进行微调,以增强其数学推理能力,而无需依赖任何符号验证程序。具体而言,EIT包含两个关键步骤:用推理计划丰富(ERP)和用推理步骤丰富(ERS)。前者生成高层次的计划,将复杂指令分解为一系列更简单的目标,而ERS填补人类注释员常忽略的推理上下文,为LLM微调创建更平滑的推理轨迹。与仅依赖LLM内部知识生成推理链的现有CoT提示方法不同,我们的方法利用人工标注的初始答案作为“元知识”来帮助LLM生成更详细和精确的推理过程,导致为复杂数学问题提供更可信的LLM专家。在实验中,EIT在GSM8K上实现了84.1%的准确率,在MATH上实现了32.5%的准确率,超越了最先进的微调和提示方法,甚至与工具增强的方法相当。
引用
@article{arxiv.2412.16964,
title = {System-2 Mathematical Reasoning via Enriched Instruction Tuning},
author = {Huanqia Cai and Yijun Yang and Zhifeng Li},
journal= {arXiv preprint arXiv:2412.16964},
year = {2024}
}