改进大语言模型微调以求解数学问题
计算与语言
2023-10-17 v1
摘要
尽管大语言模型(LLMs)在许多自然语言任务中取得成功,求解数学问题对其而言仍是一项重大挑战。LLM在求解数学问题时的一次通过(pass-at-one)与N次通过(pass-at-N)性能之间存在巨大差距,表明LLM可能接近找到正确解,这促使我们探索微调方法以释放LLM的性能。利用具有挑战性的MATH数据集,我们研究了三种微调策略:(1)解答微调,即微调模型以为给定数学问题生成详细解答;(2)解答簇重排序,将LLM微调为解答验证器/评估器,从生成的候选解答簇中进行选择;(3)多任务顺序微调,将解答生成与评估任务高效整合以提升LLM性能。借助这些方法,我们对一系列PaLM 2模型开展了详尽的实证研究,发现:(1)用于微调的逐步解答的质量与风格会对模型性能产生显著影响;(2)解答重排序与多数投票单独使用时均能提升模型性能,二者结合可获得更大提升;(3)将解答生成与评估任务顺序分离的多任务微调,相较解答微调基线可提供改进的性能。基于这些见解,我们设计了一种微调方案,经微调的PaLM 2-L模型在MATH数据集上达到约58.8%的准确率,较采用多数投票的预训练PaLM 2-L模型少样本性能提升11.2%。
引用
@article{arxiv.2310.10047,
title = {Improving Large Language Model Fine-tuning for Solving Math Problems},
author = {Yixin Liu and Avi Singh and C. Daniel Freeman and John D. Co-Reyes and Peter J. Liu},
journal= {arXiv preprint arXiv:2310.10047},
year = {2023}
}