ChatGLM-Math:通过自我批判流水线提升大型语言模型的数学问题求解能力
计算与语言
2024-04-04 v1
摘要
大型语言模型(LLM)已展现出对人类语言的出色掌握,但在需要数学问题求解的实际应用中仍然存在困难。尽管已经开发了许多增强 LLM 数学能力的策略和数据集,但在已部署的 LLM 系统中同时维持和提升语言与数学能力仍然是一个挑战。在本工作中,我们定制了自我批判流水线,以解决 LLM 对齐中反馈学习阶段的挑战。我们首先从 LLM 本身训练一个通用的数学批判模型以提供反馈信号。然后,我们依次对 LLM 自身的生成内容采用拒绝微调和直接偏好优化来进行数据收集。基于 ChatGLM3-32B,我们在学术数据集和我们新创建的挑战性数据集 MathUserEval 上进行了一系列实验。结果表明,我们的流水线显著增强了 LLM 的数学问题求解能力,同时仍提升了其语言能力,表现优于规模大两倍的 LLM。相关技术已部署到 ChatGLM\footnote{\url{https://chatglm.cn}},一个在线服务的 LLM。相关评估数据集和脚本发布于 \url{https://github.com/THUDM/ChatGLM-Math}。
引用
@article{arxiv.2404.02893,
title = {ChatGLM-Math: Improving Math Problem-Solving in Large Language Models with a Self-Critique Pipeline},
author = {Yifan Xu and Xiao Liu and Xinghan Liu and Zhenyu Hou and Yueyan Li and Xiaohan Zhang and Zihan Wang and Aohan Zeng and Zhengxiao Du and Wenyi Zhao and Jie Tang and Yuxiao Dong},
journal= {arXiv preprint arXiv:2404.02893},
year = {2024}
}